一、案例背景
1986年,MIT教授Marvin Minsky在其著作《The Society of Mind》中提出一个影响深远的观点:智能未必来自某个无所不能的“大脑”,而可能源于众多智能体(agents)通过分工、连接和协作共同涌现。四十年后的今天,这一思想在大模型时代获得了新的生命力。
2026年8月,国际人工智能联合会议(IJCAI)在德国不来梅召开。纵观本届大会议程,Agent、Multi-agent、Robotics、Reinforcement Learning等关键词格外醒目。这些并非大模型时代才出现的新问题——规划、决策、多智能体协作、机器人控制等研究已存在数十年,过去分属不同的研究传统,拥有各自的算法、数据和评价体系。而如今,一个拥有强大语言理解和推理能力的大模型,正在试图进入并重组这些系统。
这一趋势为中国AI产业提供了独特的观察窗口。过去两年,国内AI竞争的核心是“谁的模型更强”;而到了2026年,竞争焦点正在发生微妙而深刻的转变:当模型能力逐渐趋同,谁有能力将其嵌入足够复杂的业务系统,成为决定胜负的关键。
“纳须弥于芥子”——在极小之中容纳巨大的世界。这一佛教典故恰如其分地描绘了当前大模型的发展路径:规划系统、知识库、工具系统、记忆系统、决策系统,这些过去彼此分离的智能能力,正在被收束进一个可以理解、调用和协作的统一载体。
阿里与字节:两条Agent技术路线
阿里巴巴和字节跳动代表着两种不同的Agent发展路径。
阿里更像是给Agent制造“技能”。其Qwen-CUA模型将能力推进到Computer Use阶段——模型不再依赖网页结构或专用接口,而是通过观察屏幕、操作鼠标和键盘完成任务。与此同时,Qwen DianJin针对金融Agent场景,将能力拆解为Process Reward Model、工具调用和Skill Library等模块,其中Fin-PRM已被IJCAI 2026接收。这些工作的核心工程思路在于:大模型能力不能是一个黑盒,而需被拆解、评价、训练和复用——即建立一套可调用的“技能体系”。
……