MiniMax开源首个推理模型M1

6月17日,Minimax正式开源推理模型M1,采用Lightning Attention机制的混合注意力架构。M1支持目前业内最高100万token上下文输入,同时支持最多8万token输出。成本表现方面,M1在用8万Token深度推理的时候,需要使用DeepSeek R1约30%的算力。

团队表示,M1整个强化学习阶段只用到512块H800三周时间,租赁成本为53.74万美金。

展开阅读全文

更新时间:2025-06-18

标签:科技   模型   成本   上下文   注意力   架构   深度   业内   机制   团队   阶段

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight 2020- All Rights Reserved. Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号

Top