WeChatのAIチームが617BパラメータにスケールアップしたWeLMモデルを発表

Today's Brief

WeChatのAIチームが617BパラメータにスケールアップしたWeLMモデルを発表

テンセントのWeChat AIチームは、WeLMモデルのスケーリング戦略を発表しました。WeLM-HD4-80BとWeLM-HD4-617Bを導入し、Hidden Decodingを使用して、基準値を大幅に超えるパラメーターの活性化とパフォーマンスの向上を実現しています。

Explorineer Edit
WeChatのAIチームが617BパラメータにスケールアップしたWeLMモデルを発表

핵심 정리

  • 1

    Tencent は、新しい WeLM モデルを発表しました。その一つは、80 億個のパラメータを持つ WeLM-HD4-80B、もう一つは、617 億個のパラメータを持つ WeLM-HD4-617B です。

  • 2

    使用されている手法は、Hidden Decoding と呼ばれ、Transformer のバックボーンを変更せずにトークンを複数の計算ストリームに展開します。

  • 3

    80 億個のパラメータを活性化させる 80B モデルと、23 億個のパラメータを活性化させる 617B モデルの両方が、9 つのベンチマークで自己回帰ベースラインを上回りました。

  • 4

    トレーニングコストはかなり高額で、80B モデルではベースラインの 5.1 倍、617B モデルでは 4.4 倍となっています。

テンセントのWeLMモデルの革新的な拡張は、AIの現在のトレンドを示し、巨大なパラメータモデルに向かう動きを強調し、先端AI開発に必要な膨大なリソースの重要性を浮き彫りにしています。

관련 태그

この進歩は、OpenAIのGPTの進展など、AIモデルのますます大規模化する傾向を反映しています。2025年までに、高いトレーニングコストが報告されているように、AIモデルのトレーニングにおける効率性とコスト効果の向上に重点が置かれるでしょう。
ID · d08f78f5-ce99-4c69-8063-2d7a57a6fd90

매일 10분, 앱에서 만나보세요

Explorineer iOS 앱에서 개인화된 브리핑을 받아보세요.

App Store에서 받기

Keep reading

다른 브리핑도 살펴보세요