一、案例背景
1.1 从大模型到智能体:AI产业的下一个拐点
2026年9月12日,上海外滩大会的”Agent Post-Training:智能本质与下一个Scaling Law”见解论坛座无虚席。这场由蚂蚁集团、CAMEL AI、英伟达、美团等企业和机构共同参与的论坛,聚焦一个正在重塑AI产业格局的核心命题:当大模型从”回答问题”走向”执行任务”,衡量AI能力的标准正在发生根本性变化。
过去三年,大模型产业的竞争主线是参数规模与基准测试分数。从GPT-4到Claude 3,从Gemini到国产的百灵、通义、文心,各家企业围绕MMLU、HumanEval等静态基准展开激烈角逐。然而,当模型开始调用工具、操作软件、执行跨系统的复杂工作流时,传统的评测范式迅速失效——一个模型可以在考试中得高分,却无法在真实环境中持续行动、检查结果并根据反馈调整策略。
这一转变将”Agent”(智能体)推向了产业舞台的中央。所谓Agent,是指能够感知环境、自主决策并采取行动以实现特定目标的大模型应用形态。与传统的问答式AI不同,Agent需要具备任务规划、工具调用、环境交互、错误恢复和自我评估等复合能力。这些能力无法仅靠预训练获得,而需要通过”后训练”(Post-Training)——即在基础模型之上,通过强化学习、环境交互、经验积累等方式进行能力塑造。
1.2 论坛核心参与者
本案例涉及三家在Agent后训练领域具有代表性的企业:
蚂蚁集团(蚂蚁百灵大模型) 。蚂蚁百灵大模型负责人周俊在论坛上介绍了Ling-3.0体系。作为蚂蚁集团自主研发的基础模型体系,百灵承载着将AI能力嵌入医疗、金融、法律等专业场景的战略使命。蚂蚁集团2025年财报显示,其AI研发投入同比增长超过40%,其中Agent方向的投入占比显著提升。周俊提出”高质效、可专业化、可信执行”三大关键词,反映了蚂蚁在专业场景中对Agent可靠性的极致追求。
……