首页 > 新闻 > 评论

分享到微信

打开微信,点击底部的“发现”,
使用“扫一扫”即可将网页分享至朋友圈。

AI三大投入中,普通企业只有一张牌

第一财经 2026-09-28 19:57:52 听新闻

作者:刘劲 ▪ 段磊    责编:刘菁

对企业家而言,数据质量将成为AI时代竞争力分化的重要来源,值得战略级的重视。

AI有三大投入:算力、算法、数据。过去两年,公众的注意力大多给了前两者——芯片竞赛、模型迭代。但没有数据,再强的模型也无从训练;到了应用环节,模型能力能兑现多少,又直接取决于数据准备到什么程度。要理解大模型为什么会撞上“数据墙”、AI进入具体行业后为什么常常用不好,都得先回到一个基本问题:数据到底是什么。

数据的两个特性

宇宙最基本的组成元素只有三种:物质、能量、信息。物质和能量是“实体”,信息是对实体的映射,数据则是对信息的记录。理解数据的经济逻辑,要从它区别于物质和能量的两个特性说起。

第一个特性是非竞争性。物质和能量都是“竞争性”的:一个馒头只能吃一次,一吨铁矿石只能进一座高炉。数据没有这种竞争性,同一份病历、同一批驾驶记录、同一组工业参数,可以同时被多家机构、多套模型使用,同时复制成本极低,这意味着,数据被使用得越广,创造的总价值就越大。

第二个特性是排他性,它来自产权而非物理。数据可以被无限复制,并不意味着任何人都有权取得和使用它。数据的稀缺,正是由产权界定出来的。数据产权的归属多种多样:病历、基因、支付记录、出行轨迹这类数据的产权属于个人,是个人隐私;工厂的设备参数、良率数据、故障日志这类数据的产权属于企业,是商业秘密;能源、交通、金融、地理空间等涉及国家安全的数据,产权可能属于政府,是国家机密。

这两个特性合在一起,构成了数据经济的核心矛盾:非竞争性意味着共享能创造更大的总价值,排他性却让拥有者有充分理由限制共享。真正能大幅提升智能的高价值数据,恰恰是最拿不到的那部分。当高价值数据握在企业手里,出于竞争顾虑,理性的选择往往是囤积而非共享,于是数据在系统层面呈现出人为的稀缺。

数据墙:免费数据时代正在结束

大模型训练消耗的,某种意义上是人类积累的“库存”。预训练语料里占大头的互联网文本,是过去数十年人类生产、沉淀下来的信息;其中的图书与经典文献,更代表着几千年的积累。但互联网文本增长早已从早年的成倍扩张降到个位数,网页平均文本量近十年年增长只有2%~4%,而前沿模型的胃口还在按代际成倍扩大。供给的细流对上需求的洪峰,这就是“数据墙”。但要注意一个关键区分:它是有效供给的墙,不是数据总量的墙。真正收紧的,只是公开可得、可合法使用的那一部分。越容易得到的数据越不值钱,越值钱的数据越得不到。

数据墙的另一面,是供给方式的根本转换。过去十年,训练数据基本是免费“捡来的”,现在AI把数据的价值抬了起来。于是我们看到:未经授权的图书语料因版权投诉下架,社交平台不再允许免费抓取用户内容,新闻机构从起诉转向收费授权。Reddit向Google开放社区内容,作价约每年6000万美元;新闻集团与OpenAI的五年协议总额超过2.5亿美元。

从此以后,数据要么花钱买、要么花钱造、要么靠制度去解锁,三条路各有代价。花钱买,意味着数据成为有明确价格的资产,上面两笔交易就是这个新市场最早的报价。花钱造,意味着用机器生产合成数据,把“高质量”和“昂贵的人类标注”解耦;但合成数据不会自动扩展知识的边界,效果高度依赖外部验证——在有验证手段的领域(如数学、代码),它是放大能力的杠杆,在没有验证手段的领域,它放大的往往只是噪声。靠制度解锁,则是用规则改变激励,让原本锁着的数据愿意流动。无论走哪条路,采摘“低垂果实”的时代都已结束;接下来的竞争,取决于更深的开采能力:谁能把散落的数据、隐性的经验、专家思维的轨迹,转化为可学习、可治理、可持续供给的高质量数据,谁就更可能推动AI能力的下一次跃迁。

产业卡点同样在数据

数据墙描述的是前沿模型层面的宏观约束。当AI走向具体行业,数据问题会落成两层更贴近地面的卡点。

第一层卡在训练端:通用大模型学的是公开文本,而各行业最核心的智能恰恰不在公开文本里——医生问诊时的鉴别思路、基金经理下单前的权衡、律师面对案卷的推理路径、维修工程师排障时的直觉,这些专业判断的“过程性记录”在互联网上几乎不存在。

第二层卡在应用端:企业自己的数据没有准备好。数据公司Precisely与德雷塞尔大学2024年的调查显示,只有约12%的受访组织认为自己的数据质量与可及性足以支撑有效的AI应用;Informatica 2025年对首席数据官的调查中,约43%把数据质量与就绪度列为AI从试点走向生产的首要障碍。

就具体行业来说,制造业的困难是“有而不可用”:工厂不缺数据,难在各套系统出自不同厂商、不同年代、不同协议,口径互不对齐;更大的缺口还在系统之外——资深工程师的判断、故障时先查什么、参数异常时敢不敢继续生产,这些大多从未落成记录;就算数据凑齐,还有验证这一关,产线对错误近乎零容忍,AI无法像在聊天框里那样试错学习。医疗的困难则是“多而不通”:隐私与合规把数据锁在医院之内,跨院流动举步维艰;标注要占用最稀缺的资源——优秀医生的时间;治疗效果的反馈以年计,验证闭环极慢;而病历里存的是结论不是推理,医生真正的鉴别诊断思路不会写进病历。

也有一个正面样本,就是编程。AI渗透最深、效果最显著的应用领域是编程。编程几乎满足了“有效数据”的每一个条件。可得性上,仅GitHub一家平台就托管了逾5亿个代码仓库、注册开发者超过1.8亿,全球工程师把代码连同修改记录、评审意见、问题讨论一起公开托管,开源许可证又为复用敞开了大门。质量上,代码是形式语言,语法约束明确,远比自然语言更容易被机器解析。验证上,代码自带“判卷”机制,能不能编译、测试过不过,机器自己就能判定,训练信号天然可验证。过程上,版本历史大量保留了“这道题是怎么一步步解出来的”。更新上,全球开发者每天的新提交源源不断。可得、优质、可验证、有过程、能持续,五个条件,编程一个不落。

开源运动是一场提前几十年完成的制度实验,它用声誉、协作与许可协议这套激励设计,替AI预先备好了一座可验证、持续更新的数据富矿。换句话说,编程是先解决了数据的经济问题——确权与激励——才迎来了AI的繁荣。对很多行业而言,解锁数据的钥匙不在算法里,而在制度里。

数据是普通企业唯一能发力的主场

对企业来说,AI要落地,数据的准备不是可选项,而是入场券:归集、清洗、对齐、标注、治理、确权,每一项都是真金白银的投入。其中治理大致有三级:底层是常规的清洗、去重与噪声过滤;往上一级,是为重要知识建立溯源与版本控制;在高价值的专业领域,则需要精细的标注工程和领域专家的深度参与,构建“少而精”的高置信度数据集。同时,需要一条把业务中的行动、结果与失败不断回流的管道,才满足“持续更新”这个条件。

在AI的三大投入里,普通企业只有一张牌可打。算力指向芯片和数据中心,是巨头与国家的游戏;算法指向前沿模型研发,是顶尖实验室的领地;唯有数据,高度分散在各个垂直行业和场景之中。当公开数据的红利见底,模型的边际改进就越来越依赖高质量数据。而在模型方法论日趋同质的背景下,竞争焦点也正从“谁的模型更强”转向“谁的数据更干净、更稀缺、更难复制”。Meta在2025年6月以143亿美元投资数据服务商Scale AI、取得约49%的股权——巨头愿意为数据能力支付这样的对价,本身就是数据价值崛起的旁证。

企业拥有的数据里,有一部分是与自身业务长在一起的:客户偏好、工艺参数、失败经历、专家判断。这类数据能构成真正的竞争壁垒,因为它具备三个特点:它随使用而增值、迁移成本高,且难以绕开。但有独特数据不等于有利润,医疗就是反例,AI医疗影像行业普遍不赚钱。从数据积累到利润,中间还要通过一轮检验:有没有替代数据?模型通用化会不会稀释独特性?价值捕获的环节是否掌握在自己手里?更根本的边界,在于反馈闭环的性质。在反馈难以低成本建立的领域,如医疗、工业、信贷,专有数据的壁垒是结构性的;而在反馈可以自动验证的领域,如数学、编程,模型能靠自我生成、自我筛选的数据持续进化,专有数据的优势就更可能只是阶段性的。所以,评估一项数据资产的前景,第一步是先判断它所在的领域属于哪一类。

企业边界之外:技术、市场与制度

当数据的社会价值明显大于私人收益,或风险超出单个主体的承受范围,问题就必须到企业边界之外去解决。这里起作用的,主要是一种技术力量和两条制度路径。技术回答的是“如何在降低泄露风险的前提下参与训练”,却回答不了“谁有动力参与、收益怎么分”。流动性和可持续的激励,仍要靠机制设计来解决。

第一条制度路径是市场化机制,让数据拥有者在合规前提下有动力开放数据、分享增值收益,具体形态包括数据交易市场、数据信托、数据资产入表等。但这条路天然受制于数据的两个特性:排他性决定了可供交易的存量有限,场景依赖则决定了定价困难——同一份数据的价值因任务而异,很难形成统一的市场价格,因此市场化仍处在早期摸索阶段。

第二条制度路径是自上而下的公共安排,适合用于市场失灵的领域,并可按外部性的强弱分层处理。涉及国家安全与公共利益的数据,如气象、地理、人口基础信息,由政府或行业组织主导,建设公共数据平台与高质量公共数据集,把碎片资源变成基础设施;医疗健康、交通这类外部性强的民生数据,需要在统一标准与严格隐私边界下作较强的公共安排;而偏向商业竞争的数据,则应以市场化方式发现价值,政府监管而不替代市场。

更长远的制度想象,可以回到本文反复出现的那个矛盾:是给拥有者激励,还是让全社会受益?专利制度其实早就给出过一种折中——用一段有限的保护期,在两者之间取得了几百年来大体有效的平衡。数据或许也需要类似的安排:作为一项公共政策,让某些类别的数据在一定年限之后必须开放。保护期内,拥有者的投入得到回报;保护期满,被封存的智能回到公共领域。

总而言之,数据不只是技术问题,也是管理问题和经济问题。对企业家而言,数据的准备是用好AI的入场券,数据质量将成为AI时代竞争力分化的重要来源,值得战略级的重视。而因为数据的外部性,我们还须跳出企业、从国家的视角再看一层。中国有人口规模、市场纵深和完整的工业体系,积累了极其丰富的消费数据、工业数据和城市运行数据。墙内的一半靠企业治理,墙外的一半靠制度创新;让数据的拥有者得到回报,让数据的价值归于社会——AI时代的数据经济,最终要在这两端之间找到平衡。

(刘劲系长江商学院会计与金融学教授、投资研究部主任,段磊系深之度咨询合伙人)

举报

文章作者

一财最热
点击关闭