
핵심 정리
- 1
Tencent は、新しい WeLM モデルを発表しました。その一つは、80 億個のパラメータを持つ WeLM-HD4-80B、もう一つは、617 億個のパラメータを持つ WeLM-HD4-617B です。
- 2
使用されている手法は、Hidden Decoding と呼ばれ、Transformer のバックボーンを変更せずにトークンを複数の計算ストリームに展開します。
- 3
80 億個のパラメータを活性化させる 80B モデルと、23 億個のパラメータを活性化させる 617B モデルの両方が、9 つのベンチマークで自己回帰ベースラインを上回りました。
- 4
トレーニングコストはかなり高額で、80B モデルではベースラインの 5.1 倍、617B モデルでは 4.4 倍となっています。
관련 태그
この進歩は、OpenAIのGPTの進展など、AIモデルのますます大規模化する傾向を反映しています。2025年までに、高いトレーニングコストが報告されているように、AIモデルのトレーニングにおける効率性とコスト効果の向上に重点が置かれるでしょう。


