一、案例背景
1.1 企业简介
MiniMax是中国领先的人工智能大模型公司之一,由闫俊杰创立,专注于通用人工智能(AGI)基础模型的研发与商业化。公司在大模型架构设计上长期保持技术前瞻性,尤其在注意力机制(Attention Mechanism)的创新上走在行业前列。截至2024年,MiniMax已发布多代大模型产品,覆盖文本、语音、视频等多模态能力,是国内少数在底层架构层面进行原创性探索的AI企业。
1.2 行业概况:大模型竞赛中的“算力军备”
2023年至2026年,全球大模型行业进入白热化竞争阶段。模型参数从百亿级迅速攀升至千亿甚至万亿级,训练成本呈指数级增长。据行业估算,训练一次千亿参数级别的大模型,仅算力成本就可达数千万美元。在此背景下,如何在模型能力与计算成本之间找到最优平衡,成为所有大模型公司面临的核心技术经济问题。
注意力机制作为Transformer架构的核心组件,直接决定了模型的计算效率和能力上限。行业主流路线大致分为三类:
- 全局注意力(Full/Global Attention) :直接读取完整token历史,信息保留最充分,但计算和KV Cache成本随上下文长度迅速增长;
- 线性注意力(Linear Attention) :将历史压缩进紧凑状态,降低长序列计算成本,但在精确检索任务上存在信息损失;
- 稀疏注意力(Sparse Attention) :保留完整历史,仅选择部分重要信息参与计算,试图兼顾效率与精度。
2024年以来,混合注意力架构逐渐成为行业共识——不同机制在同一模型内分工协作,高效注意力负责降低成本,少量全局注意力保留精确读取能力。然而,一个更深层的问题浮出水面:原本被认为不可替代的全局注意力层,是否也能被高效注意力机制所替代?
1.3 事件来龙去脉:MiniMax的架构反复之路
MiniMax的注意力机制探索历程,几乎完整经历了这一轮行业反复:
第一阶段:押注线性注意力(2023年底)。 钟怡然自2021年起研究Linear Attention,此前最大实验模型做到15B参数。2023年底,他与MiniMax创始人闫俊杰交流后,MiniMax决定将这条尚未经过大规模验证的路线作为下一代主模型架构。这意味着公司超过80%的研发资源将投入这一方向。钟怡然认为成功概率接近99%,但闫俊杰估计只有约50%。
……