一、案例背景
2026年8月12日,中信证券发布研究报告指出,随着大模型技术竞争从“算力+算法”双轮驱动转向“算力+算法+数据”三足鼎立的格局,高质量、合规且版权清晰的数据供给稀缺性正在持续提升,优质版权数据资产价值有望迎来系统性重估。这一研判迅速引发市场关注,为数据要素市场的投资逻辑提供了新的分析框架。
行业背景:大模型竞争进入深水区
自2022年底ChatGPT发布以来,全球大模型产业经历了从百模大战到头部集中的激烈竞争。截至2026年年中,国内已备案的大模型产品超过200个,但真正具备规模化商用能力的不足十分之一。早期竞争聚焦于算力规模(GPU集群、算力调度)和算法架构(Transformer变体、MoE混合专家模型),各厂商通过堆叠算力和优化算法快速迭代模型能力。
然而,进入2025年下半年后,一个关键拐点出现:公开互联网高质量文本数据的“开采”已接近极限。据Epoch AI研究估计,全球高质量文本数据的存量约在200万亿至400万亿token之间,而头部大模型预训练所需数据量已接近这一总量的一半。数据瓶颈成为制约模型能力跃升的核心约束,行业竞争焦点开始向数据维度迁移。
数据需求的结构性变化
中信证券研报指出,大模型的数据需求正经历三重迁移:一是从通用公域数据向高质量、专业化数据迁移,模型在Coding(代码生成)、Agent(智能体)、世界模型及专业领域(金融、医疗、法律)的延伸,需要更具深度和专业性的语料支撑;二是从单一文本数据向多模态数据迁移,图像、视频、音频、3D结构等数据成为模型理解物理世界的关键;三是从静态数据集向过程数据迁移,Agent在执行任务过程中产生的交互轨迹、决策路径和反馈信号,成为模型持续进化的“养料”。
这一结构性变化意味着,拥有高质量、合规且版权清晰数据资源的机构,其战略价值将不再局限于数据本身的直接变现,而是上升为决定大模型能力上限的“战略性生产要素”。
……