铭鸿体育资讯网

#ai产业链# 英伟达为什么开始讲 Tokenomics:AI 工厂的下一层竞争,是掌握每个 Agent 任务的利润表 信源:NVIDIA《AI Factory Insider》第4期:Tokenomics 101⁠|Kaushik Shirhatti、Shruti Koparkar、Tue Tran|2026-09-01 这期视频看似在解释“什么是 token”,更重要的信号却是:英伟达正在为 ​

ai产业链 英伟达为什么开始讲 Tokenomics:AI 工厂的下一层竞争,是掌握每个 Agent 任务的利润表

信源:NVIDIA《AI Factory Insider》第4期:Tokenomics 101⁠|Kaushik Shirhatti、Shruti Koparkar、Tue Tran|2026-09-01

这期视频看似在解释“什么是 token”,更重要的信号却是:英伟达正在为企业 AI 建立一套新的生产核算体系。过去,企业评估 AI 基础设施,常看 GPU 数量、峰值 FLOPS 和每小时租金;进入 Agent 时代后,这些指标已经无法回答 CFO 最关心的问题——一项业务任务究竟消耗了多少资源,又产生了多少价值。

英伟达希望用 token 把两端连接起来:一端是模型、GPU、内存、网络和电力,另一端是收入、效率与业务结果。其官方框架把 Tokenomics 分成效用、需求、供给和变现四部分:先确定任务需要什么质量和时延,再估算 token 需求,随后优化生产成本,最后把输出转化为收入或生产率。NVIDIA 的 Tokenomics 指南⁠甚至明确提出,应从每 GPU 小时成本转向每 token 成本、每任务 token 数以及每任务成本。

这个框架之所以在2026年变得重要,是因为 Agent 改变了 AI 的需求函数。

聊天机器人的基础需求还可以粗略估算为“用户数×请求数×每次请求 token 数”;Agent 却会在用户看不见的地方产生推理 token,调用多个工具,生成子任务,在“计划—执行—检查—重试”之间反复循环。同一个用户请求,可能触发几十次模型调用。用户数量不变,token 需求仍可能增长一个数量级。

但这里需要做一个视频没有充分展开的区分:缓存命中并不会减少任务在语义上需要处理的 token,而是减少重复执行 prefill 的计算量。企业真正要分别记录的是逻辑 token、实际计算 token、计费 token和最终输出 token。把它们混在一起,既会算错基础设施需求,也会误判优化效果。

因此,Agent 时代更合理的核算单位并不是“每百万 token 多少钱”,而是:

在既定质量、时延和可靠性要求下,完成一次经过验证的任务需要多少钱。

这个成本不仅包括输入、输出和隐藏推理 token,还包括工具 API、KV cache 搬运、排队与闲置资源、失败重试、人工复核以及错误造成的损失。只要任务成功率不同,单纯比较 token 单价就没有意义。

这也解释了为什么视频后半段集中出现了 NeMo Switchyard、NeMo Relay和Dynamo。它们并不是零散的软件产品,而是在共同搭建 AI 工厂的控制层:Switchyard负责判断不同步骤应该调用小模型还是前沿模型;Relay记录模型调用、工具轨迹、延迟与消耗;Dynamo负责跨GPU调度、prefill与decode分离、KV cache管理以及集群资源协调。

模型路由的经济性已经开始显现,但并非没有代价。NVIDIA引用的LangChain测试中,Switchyard只把约7%的调用交给前沿模型,相比全程使用前沿模型降低了74%的成本,却同时损失了约6个百分点的准确率。这说明路由解决的不是“如何永远选择便宜模型”,而是在质量、成本和失败风险之间寻找动态边界。测试还显示⁠,负责判断是否升级模型的 judge 本身也会产生额外成本。

硬件层同样会被重新评价。MoE模型每次只激活部分参数,减少了计算量,却需要在不同GPU上的专家之间进行高频 all-to-all 通信。如果网络、内存或调度跟不上,理论上的模型效率便无法变成实际 token 成本优势。这意味着网络带宽、KV cache容量、内存层级和集群利用率,都会进入“每个成功任务成本”的生产函数。英伟达把Dynamo称为AI工厂的分布式操作系统,目的正是把这些原本分散的资源纳入统一调度。Dynamo 1.0⁠已经将请求路由、KV cache复用和多层存储管理放进同一个推理控制面。

英伟达的战略意图也由此显现:当模型越来越多、价格和能力快速变化时,企业不会长期把所有任务押在一个模型上,而会形成“模型组合”。模型越异构,路由、观测和调度越重要。开放模型未必削弱英伟达,反而可能让模型之上的控制层更有价值——前提是英伟达能够让这个控制层与自己的GPU、NVLink、推理引擎和企业软件形成更高的系统效率。

不过,“AI工厂生产token”仍然只是一个中间层叙事。视频自己举出的例子已经暴露其局限:零售监控可能只输出一个“是/否”token,却阻止了一次盗窃;视频字幕生成几百个token,业务价值反而可能更低。Token可以衡量计算活动,却不能天然衡量智能,更不能直接代表商业价值。

接下来最值得跟踪的指标,不是全球生成了多少万亿token,而是企业是否开始把采购和部署标准改成“每个经过验证的任务成本”。如果Switchyard、Relay和Dynamo能够持续降低这一指标,英伟达的护城河就会从GPU与CUDA进一步延伸到AI生产系统的控制权;如果企业最终选择独立、跨硬件的模型网关和Agent控制平台,那么Tokenomics可能只是一套帮助英伟达销售更多全栈基础设施的语言,而不会成为它的新利润层。