
핵심 정리
- 1
텐센트는 새로운 WeLM 모델을 발표했습니다. WeLM-HD4-80B 모델의 파라미터는 80억이며, WeLM-HD4-617B 모델의 파라미터는 617억입니다.
- 2
사용된 방법은 히든 디코딩이라고 불리며, 트랜스포머 백본을 변경하지 않고 토큰을 여러 계산 스트림으로 확장합니다.
- 3
80억 모델은 30억 파라미터를 활성화시키고, 617억 모델은 230억 파라미터를 활성화시킵니다.
- 4
두 모델은 9가지 벤치마크에서 오토리그레시브 베이스라인을 초과했습니다.
- 5
교육 비용은 상당히 높았는데, 80B 모델은 베이스라인 대비 5.1배, 617B 모델은 4.4배였습니다.
관련 태그
이 발전은 OpenAI의 GPT 발전과 같은 분야의 발전과 유사하게, 점점 더 큰 AI 모델로 향하는 성향을 반영하고 있습니다.2025년까지는 AI 모델 훈련에서 보고된 높은 훈련 비용에서 볼 수 있듯, 효율성과 비용 효율성에 보다 강조가 되겠습니다.


