一、案例背景
2026年8月12日凌晨,中国人工智能企业DeepSeek在毫无预兆的情况下,正式发布了其旗舰模型DeepSeek V4 Pro 0813版本。这一发布时间距离预览版发布仅111天,距离V4 Flash正式版发布不足半月,显示出DeepSeek在模型迭代速度上的惊人节奏。
作为全球AI大模型领域的”价格屠夫”,DeepSeek自成立以来便以极致性价比著称。此次V4 Pro正式版延续了这一传统:每百万token输入(缓存未命中)定价3元、输出定价6元,与预览版价格完全一致,恰好是V4 Flash的三倍。在OpenAI、Anthropic等国际巨头动辄数十美元定价的背景下,DeepSeek的价格优势依然具有碾压性。
然而,真正令业界震动的并非价格,而是性能的飞跃。根据DeepSeek官方及第三方评测数据,V4 Pro正式版在Agent能力上实现了质的突破:
- DeepSWE基准(DeepSeek自家软件工程基准):从预览版的12.8分飙升至62.7分,提升近5倍
- DSBench-Hard(全栈开发基准困难子集):分数翻倍,达到67.2分
- NL2Repo(自然语言生成代码仓库):从38.5分提升至61.5分
这些数据意味着,同一个API名称下,模型在一天之间从”基本不会做Agent任务”跃升至”能够与全球第一梯队代码Agent掰手腕”的水平。尽管在部分测试中与开源界标杆KIMI K3仍存在轻微差距,但考虑到价格差异,DeepSeek再次维护了其”比我强的没我便宜,比我便宜的没我强”的市场秩序。
值得注意的是,这次更新还隐藏着一个”大招”:DeepSeek Harness即将发布。在AI工程研究领域,业界已逐渐形成共识——随着底层模型推理能力逼近天花板,真正决定AI Agent能力的将不再是模型本身,而是运行框架(Harness)。如果说大语言模型是数字员工的大脑,Harness就是其办公系统,负责权限分配、工具调用、流程审批、结果检查与日志保存。DeepSeek显然正在构建从”大脑”到”办公系统”的完整闭环。
……