
{{aisd}}
AI生成 免责声明
当卖铲子的人开始为矿工的矿场和租金提供担保,华尔街先买了卖铲子人的违约保险。
7月份硅谷有三组信号和华尔街遥相呼应,引发了关于AI估值、资本结构和现金流转化的新一轮讨论。
7月26日,《华尔街日报》披露,英伟达(Nvidia)正在洽谈为OpenAI提供约2500亿美元的融资托底,帮助后者租用软银(SoftBank)旗下SB Energy在俄亥俄州南部开发的10吉瓦数据中心。包括内部芯片在内,该项目总成本可能超过5000亿美元。报道所称的托底主要覆盖租约和建设债务,并不包括英伟达芯片;另有一项最高约3500亿美元的GPU采购融资也在讨论中。
这还不是已经签署的最终合同,更不是英伟达需要立刻支付2500亿美元现金。但信用市场开始重新定价风险。
7月27日,英伟达股价下跌5%。根据彭博社(Bloomberg)援引ICE Data Services的数据,其五年期信用违约掉期(CDS)保费盘中最多上升约14个基点,达到每年约82个基点,是该合约自2025年11月进入活跃交易以来最大的单日盘中升幅。简单理解,为1000万美元英伟达债务购买五年期违约保护,年化保费大约由6.8万美元升至8.2万美元。
一些投资者把这看作AI泡沫到达阶段性顶部的信号。但需要区分:买入CDS不等于断言英伟达即将违约,也不必然等同于股票投机性做空。债券持有人、银行和交易商都可能用CDS对冲新增敞口。82个基点仍远低于困境债务水平,而且这只合约交易历史很短,所谓"纪录"缺少完整周期可比性。
真正新的信号是:过去只给英伟达收入和估值定价的市场,开始给它承担的尾部信用风险定价。
美东的华尔街解读美西的硅谷企业,有时候是隔靴搔痒,不但千里之遥而且存在时差,然而春江水暖鸭先知,与笔者交流的多位硅谷企业家、研究员和投资人对当前估值水平有不同看法:一部分认为某些AI子行业的估值已经偏高,存在阶段性调整压力;一部分认为这是长周期产业革命的早期阶段,当前估值反映的是未来十年的增长预期;还有一部分实干创业者已经不再关注二级市场估值,而是给服务的企业增加了审计层,审计每一个人的token消耗、审计每一个token的投入回报比。
今年7月,硅谷已经出现三组彼此咬合的信号。
7月1日,英伟达宣布与AI云服务商建立一种新的"收入分成与信用支持"模式。几天后,半导体研究机构SemiAnalysis进一步披露,英伟达正在为部分Neocloud(新兴AI云服务商)提供长期算力承购支持:当第三方租赁需求不足时,英伟达按照预先约定的价格承接算力;当租赁收入超过保底线时,英伟达分享部分超额收益。
SemiAnalysis因此把英伟达称为"AI中央银行"。该机构预计,基于特定假设和模型,2024年至2029年AI相关累计资本开支可能达到约11.1万亿美元,到2029年相关未偿债务余额可能增至约7.1万亿美元——这是基于当前投资轨迹和融资结构的推演,而非既定事实。在其比较的资产支持型债务类别中,这一规模仅次于美国住房抵押融资市场。
但这个巨额预测恰恰揭示了英伟达战略转型的底层逻辑:如果未来五年真的会有11.1万亿美元投入AI基础设施,那么谁来保证这些投资能产生足够的现金流偿还7.1万亿美元债务?答案不是简单地卖更多芯片,而是提高每一块GPU的使用效率和价值转化率——这正是英伟达从"卖GPU"转向"管理GPU全生命周期"的原因。
SemiAnalysis的预测存在不确定性,但它提出了一个关键问题:当企业GPU利用率普遍不高时,为什么还需要如此巨额的新增投资?一个可能的答案是市场分层——大型数据中心(OpenAI、Anthropic、微软)的GPU利用率可能远高于中小企业;英伟达通过信用支持和收入分成,实际上是在为这些高效使用者提供担保,同时通过Run:ai等软件帮助中小企业提高利用率。这不是矛盾,而是一个双向市场:顶部客户需要更多算力,底部客户需要更高效率。
第三组数字来自算力的使用端。VentureBeat 7月10日发布的一组企业AI调查最初称,86%的自营GPU企业报告利用率不超过50%。随后公布的基础设施专项报告进一步澄清:在107家合格企业中,有100家自行运营GPU;按受访者去重后,其中83家报告利用率不超过50%。分档回答中,49%选择"不超过25%",8%表示没有测量利用率——由于题目允许多选,部分答案存在重叠。只有44%的受访企业表示,自己能够严格追踪AI算力的成本和回报。
需要强调的是,这项调查的样本偏向中型企业和AI部署早期企业,并不代表微软(Microsoft)、Meta等超大规模运营商的实际状况,也不等于对全球GPU集群的实时监测。因此,83%这个数字反映的是特定样本群体的自报状态,而非全行业的普遍现实。
上游正在用信用创造更多GPU供给,下游却尚未充分利用已经拥有的GPU;当英伟达继续为需求提供信用时,资本市场又开始为英伟达的信用购买保险。AI产业同时出现了"融资性短缺"、"运营性过剩"和"风险向上游集中"。
这不是两个问题,而是同一个问题的两端:芯片可以通过贷款买入,数据中心可以通过债务建成,但债务最终不能靠GPU数量偿还,只能靠GPU所产生的现金流偿还。无论是训练端的H100还是推理端的优化芯片,最终都要回答同一个问题:能否产生足够的现金流偿还债务?
英伟达不是银行,但它正在提供信用增级
英伟达并没有直接变成一家商业银行,也不是严格意义上的"最终贷款人"。更准确地说,它正在成为AI基础设施的最终承购方、信用增级者和风险缓冲器。
传统的GPU项目融资存在一个三角困局:Neocloud需要先拿到客户的长期算力采购合同,银行才愿意放贷;它又需要先获得贷款和股权资金,才能缴纳设备定金并向客户证明交付能力;数据中心运营商同样要看到客户和融资,才愿意为它预留机房和电力。
过去,解决这个困局的通常是微软、谷歌(Google)、亚马逊(Amazon)或Meta等投资级客户签署的长期"照付不议"合同。银行真正承保的不是Neocloud的经营能力,而是合同另一端大客户的信用。
英伟达的新安排把自己的AA/Aa2级信用放到了这个结构中。根据SemiAnalysis的描述,其典型支持期限约为六年。银行可以在最保守的情景下,估算英伟达承购算力所形成的最低现金流,再决定贷款规模和利率。Neocloud因此不必只服务少数签署五年合同的超大客户,也可以把算力出租给需要一年、几个月甚至更短周期的AI公司。
这对英伟达有三重价值:扩大GPU买家范围,把硬件销售延伸为持续的收入分成,并削弱大客户自研芯片带来的集中度风险。
从战略转型角度看,英伟达正在从单纯的"芯片供应商"演变为"AI基础设施全生命周期服务商"。通过收购Run:ai(英伟达于2024年4月宣布收购,因欧盟反垄断审查推迟数月完成交割)、整合CUDA、NIM和TensorRT-LLM等软件栈,英伟达能够帮助客户从融资、部署、调度到优化的每一个环节。这不仅提高了客户粘性和迁移成本,也扩大了英伟达的可服务市场(TAM)——当客户的工作流、成本管理和推理性能越来越依赖英伟达软件时,即使芯片性能差距缩小,CUDA生态的锁定效应仍然存在。
短期来看,帮助客户提高GPU利用率可能减少一部分冗余采购;但长期来看,如果效率提升降低了单位任务成本,反而可能释放出更多原本无法承受AI成本的应用场景,从而扩大总需求。梁文峰的案例就是一个缩影:当企业通过效率工具证明了Per Token ROI,它们不会减少采购,而是会加大投入。这种"效率提升→成本下降→需求扩张→总算力增加"的正向循环,是英伟达战略转型的积极逻辑。
但信用支持从来不是免费的魔法。英伟达一边确认了更多GPU订单,一边也把自己的信用与下游租赁需求连接起来。如果第三方需求不足,英伟达不仅是卖出铲子的人,也可能成为最后接住闲置铲子的人。
"AI中央银行"这个比喻最值得注意的,恰恰是它的另一面:中央银行可以在市场缺乏流动性时托底,但托底者也会集中承担系统最后一层风险。
华尔街第一次给"AI中央银行"投下反对票2500亿美元托底之所以震动市场,并不只是因为数字巨大,而是它把英伟达模式中的隐含关系变成了显性的或有风险。
第一,OpenAI没有投资级信用评级,软银开发数据中心,银行提供项目融资,英伟达则用自己的AA/Aa2级信用降低贷款人风险。风险没有消失,只是从OpenAI和项目公司的一端,向英伟达的资产负债表转移。
第二,这种结构加深了"循环融资"争议:英伟达出售GPU,同时投资或支持购买GPU的客户,再通过最低收入、租约或债务担保确保项目能够继续采购。只要Token需求、租赁收入和融资市场同时扩张,这个循环会强化增长;一旦其中一环停顿,原本分散在客户、数据中心和银行之间的风险,会沿着担保链条重新汇聚到英伟达。
第三,信用市场担心的不是英伟达今天付不起钱,而是它未来需要为多少尚未被最终需求验证的收入负责。根据英伟达财报,其2025财年(截至2025年1月)经营现金流约为550亿美元;市场预期2026财年经营现金流将显著增长,但具体数字仍取决于需求持续性和毛利率稳定性。2500亿美元也不是立即支出;但如此规模的或有承诺足以改变投资者观察它的方式。过去市场把英伟达当成高毛利芯片公司,现在必须同时评估它作为承购方、融资方和担保人的尾部风险。
这也是为什么此次CDS变化比单日股价更值得关注。股票下跌可以反映估值、仓位和情绪;CDS扩大则直接说明,为英伟达信用风险购买保险变贵了。它不是危机警报,却是风险开始进入价格。
泡沫是否已经见顶,现在下结论仍然过早。正如黄仁勋在7月22日接受Axios采访时所说,未来五年都不太可能出现泡沫,因为供给端的物理约束(芯片、内存、电力、土地、建筑工人全都不够)会自然控制过热节奏。但一个更值得警惕的结构性信号是:当边际需求需要由供给方提供越来越多信用,增长就不再只是产品需求问题,而开始成为资产负债表问题。
当前AI行业的估值分化确实明显:一些成熟的应用公司已经证明了商业模式,另一些高估值公司仍在验证从技术到收入的转化路径。泡沫真正接近顶部的信号,不只是估值高,而是边际需求必须由供给方自己融资,才能继续增长。
因此,2500亿美元担保并没有推翻"AI中央银行"的判断,反而完成了这个比喻的另一半:中央银行不仅创造流动性,也会成为市场集中购买信用保险的对象。
企业不能让芯片吃灰:GPU利用率催生新市场VentureBeat的调查揭示了一个尚未被充分开发的市场机会。
首先,573名技术主管是五项并行调查合计的受访规模,并不是GPU问题的实际分母。基础设施专项调查的合格样本是107家企业,其中100家自行运营GPU。其次,这是一项企业自报调查,样本偏向中型企业和AI部署早期企业,不代表微软、Meta等超大规模运营商,也不等于对全球GPU集群的实时监测。
更关键的是,"GPU利用率"并不是一个单一指标。它可能指流处理器活跃度、显存带宽、功耗、模型算力利用率,也可能只是企业对已购容量的主观估计。GPU全天开机但只承担轻负载,与GPU完全闲置12个小时,是两种不同的经济状态。
但这组数据真正的价值,不是证明AI需求崩塌,而是揭示了一个巨大的效率提升空间——当企业意识到自己浪费了什么,就会寻找解决方案。这正在催生一个全新的软件市场。
低利用率可能来自四层原因,每一层都对应着一个潜在的软件市场。
第一层是需求缺口。企业买了GPU,却没有足够多进入生产环境的AI应用。这需要行业工作流软件,把通用模型能力转化为具体的业务解决方案。
第二层是调度缺口。工作负载存在,但训练、微调和推理任务无法共享资源;队列等待、显存碎片化和峰值预留造成了结构性闲置。这需要GPU调度与资源编排软件,像Run:ai这样的工具正在解决这个问题。
第三层是效率缺口。GPU确实在运行,但模型选择、批处理、量化、缓存和推理引擎没有优化,同样的任务消耗了更多计算。这需要推理优化工具,在不降低结果质量的前提下降低单位Token成本。
第四层是价值缺口。企业生成了大量Token,却没有形成被客户采用的结果,没有减少人工时间,也没有增加收入。机器很忙,损益表却没有变化。这需要AI FinOps与Token审计工具,把算力成本与业务结果连接起来。
这四层不是相互排斥的问题,而是相互叠加的市场机会。提高调度效率可以解决第二层,推理优化可以改善第三层,但真正让AI投资产生回报的,是第四层的业务转化能力。
英伟达真正要保护的,是GPU资产的现金流
市场看到企业GPU低利用率,第一反应通常是:企业下一轮会少买卡,这对英伟达是利空。
这个判断只对了一半。
如果低利用率来自应用需求不足,企业无法证明AI投资回报,新的硬件采购当然可能被推迟;如果低利用率来自调度和软件效率不足,那么提高单位GPU产出、降低单次任务成本,反而可能扩大AI能够进入的业务场景。
一位在硅谷从事AI基础设施创业的企业家梁文峰向笔者分享了一个反直觉的案例:他的团队通过优化调度和推理引擎,显著提升了GPU利用率,训练出了更好的模型。按常理,效率提升应该降低采购需求。但结果是,因为模型效果显著提升,客户愿意支付更高价格,业务快速扩张,团队反而需要采购更多GPU。
"提高利用率不是为了少买卡,而是为了证明这门生意算得过来账,然后理直气壮地买更多卡。"他表示。
这个案例揭示了一个关键逻辑:效率提高最终会减少还是增加GPU需求,取决于一个条件——新增应用和Token需求的增长,能否跑赢每个Token所需算力的下降。只有当降本释放出的需求足够大,"更省算力"才会转化为"购买更多算力"。梁文峰的案例证明,当Per Token ROI足够高时,效率提升不会抑制需求,反而会证明商业模式的可行性,从而释放更大的采购预算。
这也是英伟达收购Run:ai的战略意义。Run:ai能够把GPU组成共享资源池,并按照任务、团队和优先级切分资源。它解决的不是有没有AI需求,而是已有需求能否更有效地运行在英伟达体系内。
再加上CUDA、NIM和TensorRT-LLM,英伟达正在从"卖GPU"转向管理GPU的完整生命周期:帮助客户融资、部署、调度、优化并最终出售Token。
英伟达下一场战争因此不只是提高芯片性能,而是保护整个GPU资产类别的现金流质量。只有客户赚到钱,银行才会继续贷款;只有债务能够续作,Neocloud才会继续采购;只有Token需求持续转化为收入,SemiAnalysis预测的11.1万亿美元资本开支才可能成为可承受的基础设施扩张,而不是一次资本错配。
这也是英伟达为OpenAI等大型客户提供2500亿美元信用支持的深层逻辑:它不是在赌这些客户一定成功,而是在为最有可能高效使用GPU的客户降低融资成本。OpenAI、Anthropic这类公司的GPU利用率很可能远高于中小企业——它们有专门的基础设施团队、优化的推理引擎、明确的商业模式。英伟达通过信用增级,本质上是在说:"我押注这些高效使用者能产生足够现金流,而我提供的Run:ai等工具会帮助其他企业追上来。"
从这个角度看,低GPU利用率不是英伟达的威胁,而是它的双重市场机会:对顶部客户(OpenAI/Anthropic/微软)提供信用支持帮助他们快速扩张,对中长尾客户提供效率工具帮助他们提高利用率。前者创造需求,后者释放供给——两者都指向同一个审计指标:Per Token Intelligence能否转化为可验证的收入?
7月27日的CDS变化把这个判断从产业逻辑推进到了资本市场:Per Token ROI不再只是企业管理AI成本的运营指标,也正在变成信用市场判断这些项目能否偿债的底层变量。
Per Token ROI:从概念到落地的挑战
目前的AI基础设施讨论拥有太多技术指标,却缺少一把能够连接技术、业务和资本的尺子。
GPU利用率告诉我们机器忙不忙,但不告诉我们忙得值不值;每百万Token价格告诉我们模型调用便不便宜,却不告诉我们这些Token有没有完成任务;模型跑分告诉我们能力上限,却不告诉我们企业是否因此增加收入。
本文尝试提出一套新的审计框架:Per Token ROI,即每个有效Token创造的可验证价值,相对于其全链路成本的回报。
这里最重要的词不是Token,而是"有效"。失败的推理、重复生成、无人采用的报告、没有解决问题的客服回复,都消耗Token,却不应与真正完成任务的输出获得同样权重。
这套框架可以分成三层。
第一层是硬件效率:每GPU小时产生多少通过质量验证的有效Token。它审计调度、显存、批处理和推理引擎。
第二层是单位成本:每个有效Token承担多少全链路成本,包括GPU折旧、电力、网络、存储、软件、运维以及失败重试。
第三层是业务转化:每个有效Token带来多少可验证价值,例如减少多少人工时间、提高多少转化率、缩短多少研发周期,或者形成多少新增收入。
因此,可以把PerToken;ROI写成:
Per Token ROI = 每个有效Token创造的可验证价值 ÷ 每个有效Token的全链路成本
结果高于1,才说明这套AI工作流在单位经济上创造了正向价值;如果需要计算净回报率,则在这个倍数基础上减去1。对需要依靠债务建设的算力项目,还应继续追问:这些经过验证的AI现金流,能否覆盖每年的利息和本金。
但必须承认,Per Token ROI在实际操作中面临挑战。
"有效Token"的判定标准高度主观、"可验证价值"的归因极其复杂、成本计算的边界模糊。全链路成本是否应包含数据清洗、标注、模型微调的前期投入,是否应分摊IT团队、安全审计和合规成本,不同企业的成本核算口径可能导致Per Token ROI相差数倍。
因此,Per Token ROI更适合作为一个方向性框架,而非精确的财务指标。企业可以从三个维度逐步落地:
一是建立Token使用追踪机制,记录每个任务消耗的Token数量和输出是否被采用;
二是选择少数关键场景(如客服、代码生成、数据分析)进行试点,在可控环境中测试归因方法;
三是设定行业基准和内部对照组,用相对比较代替绝对量化。
一位硅谷企业家在访谈中告诉笔者,他正在给软件客户增加Token审计层,统计Token的使用数量和输出质量。在公司内部,他甚至把"员工每周使用不到一千万Token"视为AI使用不足。这并不是行业标准,却透露出一个变化:企业管理AI,正在从"有没有采购模型"转向"每个Token是否产生结果"。
Per TokenIntelligence:黄仁勋为什么支持这个框架
7月22日,英伟达CEO黄仁勋在接受Axios采访时,从另一个角度验证了Per Token思维的重要性。
"Token其实就是所谓的嵌入,它嵌入了知识,嵌入了智能。由这台机器生成的token数字并不是一个静态的数字,它不像圆周率那样一成不变,随着时间的推移,这个数字编码了越来越高阶的智能。"他表示,"当这些数字随着时间变得越来越聪明时,就会变得更加实用和更有价值,当它们变得更有价值时,人们就愿意为此支付更高的价格。"
这段话揭示了Per Token ROI框架中一个容易被忽视的动态变量:分子和分母都在变化。
从GPT-3到GPT-4,从Claude 2到Claude 3.5 Sonnet,同样的1000个Token,今天能完成的任务比两年前复杂得多。这意味着Per Token ROI公式中的"每个有效Token创造的可验证价值"这个分子,会随着模型能力提升而自然增长——同样的客服任务,两年前需要10次对话,今天可能只需要3次;同样的代码生成,过去需要大量人工修正,现在可以直接进入生产环境。
黄仁勋所说的"PerToken Intelligence"(单位Token的智能密度)提升,本质上就是在降低完成同一任务所需的Token数量,或者说让同样数量的Token能够完成更高价值的任务——这直接提升了PerTokenROI。
但他同时也指出了另一个现实:"我们没有足够的芯片,没有足够的内存,也没有足够的土地和电力,我们没有足够的建筑工人来建造数据中心"——这些物理约束意味着,未来五年内Token的供给增速会受到限制,因此企业必须更加关注每个Token的使用效率。
这恰恰是Per Token ROI框架要解决的问题。当算力供给受限时,企业不能简单地靠"买更多卡"来解决问题,而必须回答:现有的每个Token是否被充分利用?是否产生了与成本匹配的业务价值?哪些场景的Token使用效率最高,应该优先配置资源?
黄仁勋在采访中还表达了对AI泡沫的乐观判断,认为供给端的物理约束会自然控制过热。但7月27日CDS市场的反应提醒我们,风险可能不在供给端,而在需求端的转化能力——当83%的企业报告GPU利用率不超过50%,当只有44%的企业能严格追踪AI成本和回报时,问题不是Token是否足够聪明,而是企业是否知道如何让这些聪明的Token产生可审计的业务价值。
Per TokenIntelligence的提升,为PerToken ROI的改善创造了技术基础;但只有当企业建立起从Token消耗到业务结果的完整追踪机制,才能把技术进步真正转化为偿债能力——这也是信用市场在7.1万亿美元债务预测面前,最关心的底层变量。
未来真正值钱的软件,不只是让GPU从50%跑到80%,而是能够回答三件事:哪一个任务消耗了Token,哪一部分输出被业务采用,哪一美元算力最终产生了多少可审计收入。
一个新的效率市场正在形成
围绕Per Token ROI,AI基础设施正在出现四类创业机会,对应GPU利用率的四层缺口。
第一类是GPU调度与资源编排,把分散的卡、任务和团队组织成共享资源池。这是英伟达收购Run:ai的原因——解决第二层调度缺口。
第二类是推理优化,包括模型路由、量化、缓存、批处理和推理引擎,在不降低结果质量的前提下降低单位Token成本。这解决第三层效率缺口。
第三类是AI FinOps与Token审计,把GPU折旧、云账单、模型调用、失败重试和业务结果放进同一套账本。这解决第四层价值缺口——让企业看清每一美元算力最终产生了多少可审计收入。
第四类是行业工作流软件。它不只出售模型调用,而是对客服解决率、代码交付、药物筛选或金融研究等具体结果负责。这解决第一层需求缺口——只有这一层真正扩大,前三类效率提升工具才会转化为新的算力需求。
这比简单讨论"GPU是不是买多了"更重要。企业低利用率不是AI需求崩塌的证据,而是一个正在形成的软件市场的早期信号。判断这个市场能否起来,不能只看GPU有没有点亮,而要看有效Token、业务收入和债务偿付之间能否形成闭环。
算力市场正在从稀缺时代进入效率时代。第一阶段的竞争围绕谁拥有最多GPU;第二阶段的竞争,将围绕谁能让每一块GPU产生最高价值。这个转折点,正是新一代AI基础设施软件公司的创业窗口。
买卡只是资产负债表行为。把GPU利用率转化为有效Token,把有效Token转化为可计量收入,才是损益表能力。
如果GPU利用率不能转化为有效Token,Token不能转化为可计量的企业收入,那么无论是2500亿美元担保,还是7.1万亿美元AI债务市场,最终获得的都只是抵押物,而不是偿债现金流。
(作者系硅谷远眺CoremiAI创始人)
当卖铲子的人开始为矿工的矿场和租金提供担保,华尔街先买了卖铲子人的违约保险。
7月份硅谷有三组信号和华尔街遥相呼应,引发了关于AI估值、资本结构和现金流转化的新一轮讨论。
7月26日,《华尔街日报》披露,英伟达(Nvidia)正在洽谈为OpenAI提供约2500亿美元的融资托底,帮助后者租用软银(SoftBank)旗下SB Energy在俄亥俄州南部开发的10吉瓦数据中心。包括内部芯片在内,该项目总成本可能超过5000亿美元。报道所称的托底主要覆盖租约和建设债务,并不包括英伟达芯片;另有一项最高约3500亿美元的GPU采购融资也在讨论中。
这还不是已经签署的最终合同,更不是英伟达需要立刻支付2500亿美元现金。但信用市场开始重新定价风险。
7月27日,英伟达股价下跌5%。根据彭博社(Bloomberg)援引ICE Data Services的数据,其五年期信用违约掉期(CDS)保费盘中最多上升约14个基点,达到每年约82个基点,是该合约自2025年11月进入活跃交易以来最大的单日盘中升幅。简单理解,为1000万美元英伟达债务购买五年期违约保护,年化保费大约由6.8万美元升至8.2万美元。
一些投资者把这看作AI泡沫到达阶段性顶部的信号。但需要区分:买入CDS不等于断言英伟达即将违约,也不必然等同于股票投机性做空。债券持有人、银行和交易商都可能用CDS对冲新增敞口。82个基点仍远低于困境债务水平,而且这只合约交易历史很短,所谓"纪录"缺少完整周期可比性。
真正新的信号是:过去只给英伟达收入和估值定价的市场,开始给它承担的尾部信用风险定价。
美东的华尔街解读美西的硅谷企业,有时候是隔靴搔痒,不但千里之遥而且存在时差,然而春江水暖鸭先知,与笔者交流的多位硅谷企业家、研究员和投资人对当前估值水平有不同看法:一部分认为某些AI子行业的估值已经偏高,存在阶段性调整压力;一部分认为这是长周期产业革命的早期阶段,当前估值反映的是未来十年的增长预期;还有一部分实干创业者已经不再关注二级市场估值,而是给服务的企业增加了审计层,审计每一个人的token消耗、审计每一个token的投入回报比。
今年7月,硅谷已经出现三组彼此咬合的信号。
7月1日,英伟达宣布与AI云服务商建立一种新的"收入分成与信用支持"模式。几天后,半导体研究机构SemiAnalysis进一步披露,英伟达正在为部分Neocloud(新兴AI云服务商)提供长期算力承购支持:当第三方租赁需求不足时,英伟达按照预先约定的价格承接算力;当租赁收入超过保底线时,英伟达分享部分超额收益。
SemiAnalysis因此把英伟达称为"AI中央银行"。该机构预计,基于特定假设和模型,2024年至2029年AI相关累计资本开支可能达到约11.1万亿美元,到2029年相关未偿债务余额可能增至约7.1万亿美元——这是基于当前投资轨迹和融资结构的推演,而非既定事实。在其比较的资产支持型债务类别中,这一规模仅次于美国住房抵押融资市场。
但这个巨额预测恰恰揭示了英伟达战略转型的底层逻辑:如果未来五年真的会有11.1万亿美元投入AI基础设施,那么谁来保证这些投资能产生足够的现金流偿还7.1万亿美元债务?答案不是简单地卖更多芯片,而是提高每一块GPU的使用效率和价值转化率——这正是英伟达从"卖GPU"转向"管理GPU全生命周期"的原因。
SemiAnalysis的预测存在不确定性,但它提出了一个关键问题:当企业GPU利用率普遍不高时,为什么还需要如此巨额的新增投资?一个可能的答案是市场分层——大型数据中心(OpenAI、Anthropic、微软)的GPU利用率可能远高于中小企业;英伟达通过信用支持和收入分成,实际上是在为这些高效使用者提供担保,同时通过Run:ai等软件帮助中小企业提高利用率。这不是矛盾,而是一个双向市场:顶部客户需要更多算力,底部客户需要更高效率。
第三组数字来自算力的使用端。VentureBeat 7月10日发布的一组企业AI调查最初称,86%的自营GPU企业报告利用率不超过50%。随后公布的基础设施专项报告进一步澄清:在107家合格企业中,有100家自行运营GPU;按受访者去重后,其中83家报告利用率不超过50%。分档回答中,49%选择"不超过25%",8%表示没有测量利用率——由于题目允许多选,部分答案存在重叠。只有44%的受访企业表示,自己能够严格追踪AI算力的成本和回报。
需要强调的是,这项调查的样本偏向中型企业和AI部署早期企业,并不代表微软(Microsoft)、Meta等超大规模运营商的实际状况,也不等于对全球GPU集群的实时监测。因此,83%这个数字反映的是特定样本群体的自报状态,而非全行业的普遍现实。
上游正在用信用创造更多GPU供给,下游却尚未充分利用已经拥有的GPU;当英伟达继续为需求提供信用时,资本市场又开始为英伟达的信用购买保险。AI产业同时出现了"融资性短缺"、"运营性过剩"和"风险向上游集中"。
这不是两个问题,而是同一个问题的两端:芯片可以通过贷款买入,数据中心可以通过债务建成,但债务最终不能靠GPU数量偿还,只能靠GPU所产生的现金流偿还。无论是训练端的H100还是推理端的优化芯片,最终都要回答同一个问题:能否产生足够的现金流偿还债务?
英伟达不是银行,但它正在提供信用增级
英伟达并没有直接变成一家商业银行,也不是严格意义上的"最终贷款人"。更准确地说,它正在成为AI基础设施的最终承购方、信用增级者和风险缓冲器。
传统的GPU项目融资存在一个三角困局:Neocloud需要先拿到客户的长期算力采购合同,银行才愿意放贷;它又需要先获得贷款和股权资金,才能缴纳设备定金并向客户证明交付能力;数据中心运营商同样要看到客户和融资,才愿意为它预留机房和电力。
过去,解决这个困局的通常是微软、谷歌(Google)、亚马逊(Amazon)或Meta等投资级客户签署的长期"照付不议"合同。银行真正承保的不是Neocloud的经营能力,而是合同另一端大客户的信用。
英伟达的新安排把自己的AA/Aa2级信用放到了这个结构中。根据SemiAnalysis的描述,其典型支持期限约为六年。银行可以在最保守的情景下,估算英伟达承购算力所形成的最低现金流,再决定贷款规模和利率。Neocloud因此不必只服务少数签署五年合同的超大客户,也可以把算力出租给需要一年、几个月甚至更短周期的AI公司。
这对英伟达有三重价值:扩大GPU买家范围,把硬件销售延伸为持续的收入分成,并削弱大客户自研芯片带来的集中度风险。
从战略转型角度看,英伟达正在从单纯的"芯片供应商"演变为"AI基础设施全生命周期服务商"。通过收购Run:ai(英伟达于2024年4月宣布收购,因欧盟反垄断审查推迟数月完成交割)、整合CUDA、NIM和TensorRT-LLM等软件栈,英伟达能够帮助客户从融资、部署、调度到优化的每一个环节。这不仅提高了客户粘性和迁移成本,也扩大了英伟达的可服务市场(TAM)——当客户的工作流、成本管理和推理性能越来越依赖英伟达软件时,即使芯片性能差距缩小,CUDA生态的锁定效应仍然存在。
短期来看,帮助客户提高GPU利用率可能减少一部分冗余采购;但长期来看,如果效率提升降低了单位任务成本,反而可能释放出更多原本无法承受AI成本的应用场景,从而扩大总需求。梁文峰的案例就是一个缩影:当企业通过效率工具证明了Per Token ROI,它们不会减少采购,而是会加大投入。这种"效率提升→成本下降→需求扩张→总算力增加"的正向循环,是英伟达战略转型的积极逻辑。
但信用支持从来不是免费的魔法。英伟达一边确认了更多GPU订单,一边也把自己的信用与下游租赁需求连接起来。如果第三方需求不足,英伟达不仅是卖出铲子的人,也可能成为最后接住闲置铲子的人。
"AI中央银行"这个比喻最值得注意的,恰恰是它的另一面:中央银行可以在市场缺乏流动性时托底,但托底者也会集中承担系统最后一层风险。
华尔街第一次给"AI中央银行"投下反对票2500亿美元托底之所以震动市场,并不只是因为数字巨大,而是它把英伟达模式中的隐含关系变成了显性的或有风险。
第一,OpenAI没有投资级信用评级,软银开发数据中心,银行提供项目融资,英伟达则用自己的AA/Aa2级信用降低贷款人风险。风险没有消失,只是从OpenAI和项目公司的一端,向英伟达的资产负债表转移。
第二,这种结构加深了"循环融资"争议:英伟达出售GPU,同时投资或支持购买GPU的客户,再通过最低收入、租约或债务担保确保项目能够继续采购。只要Token需求、租赁收入和融资市场同时扩张,这个循环会强化增长;一旦其中一环停顿,原本分散在客户、数据中心和银行之间的风险,会沿着担保链条重新汇聚到英伟达。
第三,信用市场担心的不是英伟达今天付不起钱,而是它未来需要为多少尚未被最终需求验证的收入负责。根据英伟达财报,其2025财年(截至2025年1月)经营现金流约为550亿美元;市场预期2026财年经营现金流将显著增长,但具体数字仍取决于需求持续性和毛利率稳定性。2500亿美元也不是立即支出;但如此规模的或有承诺足以改变投资者观察它的方式。过去市场把英伟达当成高毛利芯片公司,现在必须同时评估它作为承购方、融资方和担保人的尾部风险。
这也是为什么此次CDS变化比单日股价更值得关注。股票下跌可以反映估值、仓位和情绪;CDS扩大则直接说明,为英伟达信用风险购买保险变贵了。它不是危机警报,却是风险开始进入价格。
泡沫是否已经见顶,现在下结论仍然过早。正如黄仁勋在7月22日接受Axios采访时所说,未来五年都不太可能出现泡沫,因为供给端的物理约束(芯片、内存、电力、土地、建筑工人全都不够)会自然控制过热节奏。但一个更值得警惕的结构性信号是:当边际需求需要由供给方提供越来越多信用,增长就不再只是产品需求问题,而开始成为资产负债表问题。
当前AI行业的估值分化确实明显:一些成熟的应用公司已经证明了商业模式,另一些高估值公司仍在验证从技术到收入的转化路径。泡沫真正接近顶部的信号,不只是估值高,而是边际需求必须由供给方自己融资,才能继续增长。
因此,2500亿美元担保并没有推翻"AI中央银行"的判断,反而完成了这个比喻的另一半:中央银行不仅创造流动性,也会成为市场集中购买信用保险的对象。
企业不能让芯片吃灰:GPU利用率催生新市场VentureBeat的调查揭示了一个尚未被充分开发的市场机会。
首先,573名技术主管是五项并行调查合计的受访规模,并不是GPU问题的实际分母。基础设施专项调查的合格样本是107家企业,其中100家自行运营GPU。其次,这是一项企业自报调查,样本偏向中型企业和AI部署早期企业,不代表微软、Meta等超大规模运营商,也不等于对全球GPU集群的实时监测。
更关键的是,"GPU利用率"并不是一个单一指标。它可能指流处理器活跃度、显存带宽、功耗、模型算力利用率,也可能只是企业对已购容量的主观估计。GPU全天开机但只承担轻负载,与GPU完全闲置12个小时,是两种不同的经济状态。
但这组数据真正的价值,不是证明AI需求崩塌,而是揭示了一个巨大的效率提升空间——当企业意识到自己浪费了什么,就会寻找解决方案。这正在催生一个全新的软件市场。
低利用率可能来自四层原因,每一层都对应着一个潜在的软件市场。
第一层是需求缺口。企业买了GPU,却没有足够多进入生产环境的AI应用。这需要行业工作流软件,把通用模型能力转化为具体的业务解决方案。
第二层是调度缺口。工作负载存在,但训练、微调和推理任务无法共享资源;队列等待、显存碎片化和峰值预留造成了结构性闲置。这需要GPU调度与资源编排软件,像Run:ai这样的工具正在解决这个问题。
第三层是效率缺口。GPU确实在运行,但模型选择、批处理、量化、缓存和推理引擎没有优化,同样的任务消耗了更多计算。这需要推理优化工具,在不降低结果质量的前提下降低单位Token成本。
第四层是价值缺口。企业生成了大量Token,却没有形成被客户采用的结果,没有减少人工时间,也没有增加收入。机器很忙,损益表却没有变化。这需要AI FinOps与Token审计工具,把算力成本与业务结果连接起来。
这四层不是相互排斥的问题,而是相互叠加的市场机会。提高调度效率可以解决第二层,推理优化可以改善第三层,但真正让AI投资产生回报的,是第四层的业务转化能力。
英伟达真正要保护的,是GPU资产的现金流
市场看到企业GPU低利用率,第一反应通常是:企业下一轮会少买卡,这对英伟达是利空。
这个判断只对了一半。
如果低利用率来自应用需求不足,企业无法证明AI投资回报,新的硬件采购当然可能被推迟;如果低利用率来自调度和软件效率不足,那么提高单位GPU产出、降低单次任务成本,反而可能扩大AI能够进入的业务场景。
一位在硅谷从事AI基础设施创业的企业家梁文峰向笔者分享了一个反直觉的案例:他的团队通过优化调度和推理引擎,显著提升了GPU利用率,训练出了更好的模型。按常理,效率提升应该降低采购需求。但结果是,因为模型效果显著提升,客户愿意支付更高价格,业务快速扩张,团队反而需要采购更多GPU。
"提高利用率不是为了少买卡,而是为了证明这门生意算得过来账,然后理直气壮地买更多卡。"他表示。
这个案例揭示了一个关键逻辑:效率提高最终会减少还是增加GPU需求,取决于一个条件——新增应用和Token需求的增长,能否跑赢每个Token所需算力的下降。只有当降本释放出的需求足够大,"更省算力"才会转化为"购买更多算力"。梁文峰的案例证明,当Per Token ROI足够高时,效率提升不会抑制需求,反而会证明商业模式的可行性,从而释放更大的采购预算。
这也是英伟达收购Run:ai的战略意义。Run:ai能够把GPU组成共享资源池,并按照任务、团队和优先级切分资源。它解决的不是有没有AI需求,而是已有需求能否更有效地运行在英伟达体系内。
再加上CUDA、NIM和TensorRT-LLM,英伟达正在从"卖GPU"转向管理GPU的完整生命周期:帮助客户融资、部署、调度、优化并最终出售Token。
英伟达下一场战争因此不只是提高芯片性能,而是保护整个GPU资产类别的现金流质量。只有客户赚到钱,银行才会继续贷款;只有债务能够续作,Neocloud才会继续采购;只有Token需求持续转化为收入,SemiAnalysis预测的11.1万亿美元资本开支才可能成为可承受的基础设施扩张,而不是一次资本错配。
这也是英伟达为OpenAI等大型客户提供2500亿美元信用支持的深层逻辑:它不是在赌这些客户一定成功,而是在为最有可能高效使用GPU的客户降低融资成本。OpenAI、Anthropic这类公司的GPU利用率很可能远高于中小企业——它们有专门的基础设施团队、优化的推理引擎、明确的商业模式。英伟达通过信用增级,本质上是在说:"我押注这些高效使用者能产生足够现金流,而我提供的Run:ai等工具会帮助其他企业追上来。"
从这个角度看,低GPU利用率不是英伟达的威胁,而是它的双重市场机会:对顶部客户(OpenAI/Anthropic/微软)提供信用支持帮助他们快速扩张,对中长尾客户提供效率工具帮助他们提高利用率。前者创造需求,后者释放供给——两者都指向同一个审计指标:Per Token Intelligence能否转化为可验证的收入?
7月27日的CDS变化把这个判断从产业逻辑推进到了资本市场:Per Token ROI不再只是企业管理AI成本的运营指标,也正在变成信用市场判断这些项目能否偿债的底层变量。
Per Token ROI:从概念到落地的挑战
目前的AI基础设施讨论拥有太多技术指标,却缺少一把能够连接技术、业务和资本的尺子。
GPU利用率告诉我们机器忙不忙,但不告诉我们忙得值不值;每百万Token价格告诉我们模型调用便不便宜,却不告诉我们这些Token有没有完成任务;模型跑分告诉我们能力上限,却不告诉我们企业是否因此增加收入。
本文尝试提出一套新的审计框架:Per Token ROI,即每个有效Token创造的可验证价值,相对于其全链路成本的回报。
这里最重要的词不是Token,而是"有效"。失败的推理、重复生成、无人采用的报告、没有解决问题的客服回复,都消耗Token,却不应与真正完成任务的输出获得同样权重。
这套框架可以分成三层。
第一层是硬件效率:每GPU小时产生多少通过质量验证的有效Token。它审计调度、显存、批处理和推理引擎。
第二层是单位成本:每个有效Token承担多少全链路成本,包括GPU折旧、电力、网络、存储、软件、运维以及失败重试。
第三层是业务转化:每个有效Token带来多少可验证价值,例如减少多少人工时间、提高多少转化率、缩短多少研发周期,或者形成多少新增收入。
因此,可以把PerTokenROI写成:
Per Token ROI = 每个有效Token创造的可验证价值 ÷ 每个有效Token的全链路成本
结果高于1,才说明这套AI工作流在单位经济上创造了正向价值;如果需要计算净回报率,则在这个倍数基础上减去1。对需要依靠债务建设的算力项目,还应继续追问:这些经过验证的AI现金流,能否覆盖每年的利息和本金。
但必须承认,Per Token ROI在实际操作中面临挑战。
"有效Token"的判定标准高度主观、"可验证价值"的归因极其复杂、成本计算的边界模糊。全链路成本是否应包含数据清洗、标注、模型微调的前期投入,是否应分摊IT团队、安全审计和合规成本,不同企业的成本核算口径可能导致Per Token ROI相差数倍。
因此,Per Token ROI更适合作为一个方向性框架,而非精确的财务指标。企业可以从三个维度逐步落地:
一是建立Token使用追踪机制,记录每个任务消耗的Token数量和输出是否被采用;
二是选择少数关键场景(如客服、代码生成、数据分析)进行试点,在可控环境中测试归因方法;
三是设定行业基准和内部对照组,用相对比较代替绝对量化。
一位硅谷企业家在访谈中告诉笔者,他正在给软件客户增加Token审计层,统计Token的使用数量和输出质量。在公司内部,他甚至把"员工每周使用不到一千万Token"视为AI使用不足。这并不是行业标准,却透露出一个变化:企业管理AI,正在从"有没有采购模型"转向"每个Token是否产生结果"。
Per TokenIntelligence:黄仁勋为什么支持这个框架
7月22日,英伟达CEO黄仁勋在接受Axios采访时,从另一个角度验证了Per Token思维的重要性。
"Token其实就是所谓的嵌入,它嵌入了知识,嵌入了智能。由这台机器生成的token数字并不是一个静态的数字,它不像圆周率那样一成不变,随着时间的推移,这个数字编码了越来越高阶的智能。"他表示,"当这些数字随着时间变得越来越聪明时,就会变得更加实用和更有价值,当它们变得更有价值时,人们就愿意为此支付更高的价格。"
这段话揭示了Per Token ROI框架中一个容易被忽视的动态变量:分子和分母都在变化。
从GPT-3到GPT-4,从Claude 2到Claude 3.5 Sonnet,同样的1000个Token,今天能完成的任务比两年前复杂得多。这意味着Per Token ROI公式中的"每个有效Token创造的可验证价值"这个分子,会随着模型能力提升而自然增长——同样的客服任务,两年前需要10次对话,今天可能只需要3次;同样的代码生成,过去需要大量人工修正,现在可以直接进入生产环境。
黄仁勋所说的"PerToken Intelligence"(单位Token的智能密度)提升,本质上就是在降低完成同一任务所需的Token数量,或者说让同样数量的Token能够完成更高价值的任务——这直接提升了PerTokenROI。
但他同时也指出了另一个现实:"我们没有足够的芯片,没有足够的内存,也没有足够的土地和电力,我们没有足够的建筑工人来建造数据中心"——这些物理约束意味着,未来五年内Token的供给增速会受到限制,因此企业必须更加关注每个Token的使用效率。
这恰恰是Per Token ROI框架要解决的问题。当算力供给受限时,企业不能简单地靠"买更多卡"来解决问题,而必须回答:现有的每个Token是否被充分利用?是否产生了与成本匹配的业务价值?哪些场景的Token使用效率最高,应该优先配置资源?
黄仁勋在采访中还表达了对AI泡沫的乐观判断,认为供给端的物理约束会自然控制过热。但7月27日CDS市场的反应提醒我们,风险可能不在供给端,而在需求端的转化能力——当83%的企业报告GPU利用率不超过50%,当只有44%的企业能严格追踪AI成本和回报时,问题不是Token是否足够聪明,而是企业是否知道如何让这些聪明的Token产生可审计的业务价值。
Per TokenIntelligence的提升,为PerToken ROI的改善创造了技术基础;但只有当企业建立起从Token消耗到业务结果的完整追踪机制,才能把技术进步真正转化为偿债能力——这也是信用市场在7.1万亿美元债务预测面前,最关心的底层变量。
未来真正值钱的软件,不只是让GPU从50%跑到80%,而是能够回答三件事:哪一个任务消耗了Token,哪一部分输出被业务采用,哪一美元算力最终产生了多少可审计收入。
一个新的效率市场正在形成
围绕Per Token ROI,AI基础设施正在出现四类创业机会,对应GPU利用率的四层缺口。
第一类是GPU调度与资源编排,把分散的卡、任务和团队组织成共享资源池。这是英伟达收购Run:ai的原因——解决第二层调度缺口。
第二类是推理优化,包括模型路由、量化、缓存、批处理和推理引擎,在不降低结果质量的前提下降低单位Token成本。这解决第三层效率缺口。
第三类是AI FinOps与Token审计,把GPU折旧、云账单、模型调用、失败重试和业务结果放进同一套账本。这解决第四层价值缺口——让企业看清每一美元算力最终产生了多少可审计收入。
第四类是行业工作流软件。它不只出售模型调用,而是对客服解决率、代码交付、药物筛选或金融研究等具体结果负责。这解决第一层需求缺口——只有这一层真正扩大,前三类效率提升工具才会转化为新的算力需求。
这比简单讨论"GPU是不是买多了"更重要。企业低利用率不是AI需求崩塌的证据,而是一个正在形成的软件市场的早期信号。判断这个市场能否起来,不能只看GPU有没有点亮,而要看有效Token、业务收入和债务偿付之间能否形成闭环。
算力市场正在从稀缺时代进入效率时代。第一阶段的竞争围绕谁拥有最多GPU;第二阶段的竞争,将围绕谁能让每一块GPU产生最高价值。这个转折点,正是新一代AI基础设施软件公司的创业窗口。
买卡只是资产负债表行为。把GPU利用率转化为有效Token,把有效Token转化为可计量收入,才是损益表能力。
如果GPU利用率不能转化为有效Token,Token不能转化为可计量的企业收入,那么无论是2500亿美元担保,还是7.1万亿美元AI债务市场,最终获得的都只是抵押物,而不是偿债现金流。
(作者系硅谷远眺CoremiAI创始人)