AI语料短缺瓶颈凸显 数据基建新机遇有望释放

AI语料短缺瓶颈凸显 数据基建新机遇有望释放

  AI发展的又一个关键瓶颈浮出水面——高质量、高可信度的数据,正成为AI竞争的胜负手。这也为出版、新闻等传统内容服务商向AI语料供应商转型创造了机遇,相关企业的商业价值有望迎来重估。

AI语料短缺瓶颈凸显 数据基建新机遇有望释放-第1张图片

  科技公司加码内容资源布局

  近日,A股AI语料板块走强,读客文化、中信出版、利欧股份、中国出版、海天瑞声等股价显著上涨。

  有消息称,苹果正与多家出版商洽谈新的合作协议,希望使用它们的内容来提供最新的新闻和信息,这是苹果升级AI驱动版Siri语音助手计划的重要一部分。苹果还计划采用灵活付费模式,当合作出版商的内容被Siri用户使用时,再支付相应的版权费用。

  据悉,苹果此前已与部分出版商达成协议,向出版商支付费用,以获取相关内容以及用于AI模型训练方面的使用权。

  Anthropic等科技公司也在加码布局内容资源。今年7月,一份解封的法庭文件显示,Anthropic通过代号为“巴拿马计划”的项目,斥资数千万美元批量采购数百万册2022年前出版的纸质书,完成高速扫描用于AI训练后,将这些书籍粉碎销毁,该行为被舆论称之为“AI焚书”。

  科技公司为何纷纷盯上了传统媒体的内容资源?在AI大模型快速发展的初期,行业训练大模型所用语料主要来自互联网上公开的信息,这些语料信息的合法性、准确度长期未得到充分重视。更为重要的是,在生成式AI爆发后,大量AI生成内容、合成数据也涌入互联网,再度回流成为大模型训练素材。但是,若持续使用AI生成内容迭代训练模型,将引发模型退化,出现“模型坍缩”现象。

  为获取未被AI生成内容污染的原生语料,硅谷科技巨头开始挖掘传统媒体文稿与纸质书籍价值。这类原生内容能够保障模型输出的准确度,支撑模型能力持续迭代提升。

  数据基建新机遇有望释放

  AI产业发展应具备能源、算力、数据、模型和应用五大核心要素。数据是AI大模型的“燃料”,其质量与安全性直接决定了模型价值的上限。

  据2026机器人全产业链接会披露信息,GPT-〖贰〗、 GPT-3对应的训练数据时长分别约为79万小时、1100万小时,想要实现具备实用能力的具身智能,至少需要1000万小时量级多模态数据。叠加多场景适配、多模态类型、数据良率等因素,产业实际所需多模态数据集规模将远超1000万小时。

  当前,高质量语料短缺已成为制约人工智能大模型发展的核心瓶颈,据Epoch AI预测,人类公开的高质量文本数据可能在2026年至2032年间被完全耗尽。在此背景下,高质量、高可信度的数据资源正在成为“稀缺”资源,重要性持续提升。多位接近出版社、图片版权机构等传统内容企业的人士向记者透露,国内也已经有AI公司开始向传统内容机构采购合规数据集。

  复旦大学计算与智能创新学院特聘教授、北电数智首席科学家窦德景认为,谁能掌握高质量、高可信度的行业数据,谁就能在AI竞争中占据先机。上述接近传统内容企业人士表示,传统媒体沉淀的大量优质原创内容,恰好是AI大模型所需的优质“燃料”,不仅具备高度准确、数据可信等优势,还能够规避“模型坍缩”风险。

  高质量内容数据的“语料价值”持续提升下,传统版权资产价值迎来重新评估窗口。兴业证券研报认为,数据集建设重估版权语料价值,AI应用打开IP商业化空间,网文、出版企业有望从传统内容提供商转变为合规AI训练语料供给方,自有版权文本数据稀缺性上升,资产价值具备重估空间。

  国金证券分析称,当前,数据采集已经成为物理AI发展的最大短板之一,数据基础设施加快建设有望带动数采产业链持续扩容。

(文章来源:上海证券报)

©版权声明
THE END