川流知序Chovsue

AI语料短缺凸显 数据基建新机遇待释放

2026-08-16

AI发展的又一个关键瓶颈浮出水面——高质量、高可信度的数据,正成为AI竞争的胜负手。这也为出版、新闻等传统内容服务商向AI语料供应商转型创造了机遇,相关企业的商业价值有望迎来重估。

科技公司加码内容资源布局

近日,A股AI语料板块走强,读客文化、中信出版、利欧股份、中国出版、海天瑞声等股价显著上涨。有消息称,苹果正与多家出版商洽谈新的合作协议,希望使用它们的内容来提供最新的新闻和信息,这是苹果升级AI驱动版Siri语音助手计划的重要一部分。苹果还计划采用灵活付费模式,当合作出版商的内容被Siri用户使用时,再支付相应的版权费用。据悉,苹果此前已与部分出版商达成协议,向出版商支付费用,以获取相关内容以及用于AI模型训练方面的使用权。

AI语料与数据基建趋势图 0 50 100 年份 数据量(单位:万条) AI语料 数据基建
图1 数据来源:公开信息

Anthropic等科技公司也在加码布局内容资源。今年7月,一份解封的法庭文件显示,Anthropic通过代号为“巴拿马计划”的项目,斥资数千万美元批量采购数百万册2022年前出版的纸质书,完成高速扫描用于AI训练后,将这些书籍粉碎销毁,该行为被舆论称之为“AI焚书”。

高质量数据的稀缺性

科技公司为何纷纷盯上了传统媒体的内容资源?在AI大模型快速发展的初期,行业训练大模型所用语料主要来自互联网上公开的信息,这些语料信息的合法性、准确度长期未得到充分重视。更为重要的是,在生成式AI爆发后,大量AI生成内容、合成数据也涌入互联网,再度回流成为大模型训练素材。但是,若持续使用AI生成内容迭代训练模型,将引发模型退化,出现“模型坍缩”现象。

为获取未被AI生成内容污染的原生语料,硅谷科技巨头开始挖掘传统媒体文稿与纸质书籍价值。这类原生内容能够保障模型输出的准确度,支撑模型能力持续迭代提升。

数据基建新机遇

AI产业发展应具备能源、算力、数据、模型和应用五大核心要素。数据是AI大模型的“燃料”,其质量与安全性直接决定了模型价值的上限。当前,高质量语料短缺已成为制约人工智能大模型发展的核心瓶颈。据Epoch AI预测,人类公开的高质量文本数据可能在2026年至2032年间被完全耗尽。在此背景下,高质量、高可信度的数据资源正在成为“稀缺”资源,重要性持续提升。

复旦大学计算与智能创新学院特聘教授、北电数智首席科学家窦德景认为,谁能掌握高质量、高可信度的行业数据,谁就能在AI竞争中占据先机。高质量内容数据的“语料价值”持续提升下,传统版权资产价值迎来重新评估窗口。兴业证券研报认为,数据集建设重估版权语料价值,AI应用打开IP商业化空间,网文、出版企业有望从传统内容提供商转变为合规AI训练语料供给方,自有版权文本数据稀缺性上升,资产价值具备重估空间。

国金证券分析称,当前,数据采集已经成为物理AI发展的最大短板之一,数据基础设施加快建设有望带动数采产业链持续扩容。

本文由 AI 基于公开信息自动生成,仅供学习参考,不构成任何投资建议。市场有风险,投资需谨慎。