
핵심 정리
- 1
Tencent đã công bố các mô hình WeLM mới: WeLM-HD4-80B với 80 tỷ tham số và WeLM-HD4-617B với 617 tỷ tham số.
- 2
Phương pháp sử dụng được gọi là Hidden Decoding, mở rộng các token thành nhiều luồng tính toán mà không thay đổi cấu trúc gốc của Transformer.
- 3
Mô hình 80B kích hoạt 3 tỷ tham số, trong khi mô hình 617B kích hoạt 23 tỷ tham số.
- 4
Cả hai mô hình đều vượt qua các cơ sở tự hồi quy trong chín tiêu chí đánh giá.
- 5
Chi phí đào tạo lưu ý cao: 5,1 lần so với mô hình cơ sở cho mô hình 80B và 4,4 lần cho mô hình 617B.
관련 태그


