WeChat AI 팀, WeLM 모델 617억 개 파라미터로 확장 밝혀

Today's Brief

WeChat AI 팀, WeLM 모델 617억 개 파라미터로 확장 밝혀

텐센트의 위챗 AI 팀은 WeLM 모델의 확장 전략을 발표했습니다. WeLM-HD4-80B와 WeLM-HD4-617B를 소개하며 히든 디코딩을 사용하여 기본 성능 대비 중요한 매개변수 활성화와 성능 향상을 이룩했습니다.

Explorineer Edit
WeChat AI 팀, WeLM 모델 617억 개 파라미터로 확장 밝혀

핵심 정리

  • 1

    텐센트는 새로운 WeLM 모델을 발표했습니다. WeLM-HD4-80B 모델의 파라미터는 80억이며, WeLM-HD4-617B 모델의 파라미터는 617억입니다.

  • 2

    사용된 방법은 히든 디코딩이라고 불리며, 트랜스포머 백본을 변경하지 않고 토큰을 여러 계산 스트림으로 확장합니다.

  • 3

    80억 모델은 30억 파라미터를 활성화시키고, 617억 모델은 230억 파라미터를 활성화시킵니다.

  • 4

    두 모델은 9가지 벤치마크에서 오토리그레시브 베이스라인을 초과했습니다.

  • 5

    교육 비용은 상당히 높았는데, 80B 모델은 베이스라인 대비 5.1배, 617B 모델은 4.4배였습니다.

텐센트의 혁신적인 WeLM 모델 확장은 현재 인공지능의 대규모 매개변수 모델로의 트렌드를 잘 보여주며, 선도적 AI 개발에 필요한 상당한 자원을 강조합니다.

관련 태그

이 발전은 OpenAI의 GPT 발전과 같은 분야의 발전과 유사하게, 점점 더 큰 AI 모델로 향하는 성향을 반영하고 있습니다.2025년까지는 AI 모델 훈련에서 보고된 높은 훈련 비용에서 볼 수 있듯, 효율성과 비용 효율성에 보다 강조가 되겠습니다.
ID · d08f78f5-ce99-4c69-8063-2d7a57a6fd90

매일 10분, 앱에서 만나보세요

Explorineer iOS 앱에서 개인화된 브리핑을 받아보세요.

App Store에서 받기

Keep reading

다른 브리핑도 살펴보세요