效率越高,算力越缺:Sam Altman在G20讲透了Agent时代的需求函数
信源:G20创新部长会议|Sam Altman与美国商务部长Howard Lutnick对谈|2026-09-02
Sam Altman在这场对谈中给出了一个颇具冲击力的例子:过去一家创业公司在加速器里三个月完成的工作,现在用Codex可能17分钟就能做完。这个数字显然带有演讲式夸张,但它指向的变化是真实的——AI需求正在从“有多少人使用”,转向“每个人能调度多少机器工作”。
这意味着,未来算力需求不能只看用户渗透率,还要看单个用户的任务深度。可以把它简单拆成:
总需求=活跃用户数×人均任务数×每项任务的执行轮次×并发Agent数量。
聊天机器人时代,人类问一次,模型答一次;Agent时代,模型需要规划、搜索、调用工具、编写代码、检查结果、失败重试,并在后台持续运行。即使每一步推理都越来越便宜,任务长度、执行频率和并发数量仍可能增长得更快。
Altman为此给出了一组未经审计的内部估算:2020年初,全球最重度的token用户每月大约使用10万token;到2026年中,最重度用户已经达到每月数千亿token,而全球人均月使用量接近10万。他甚至推演,六年半后全球人均可能达到每月1000亿token。他自己也承认,token是一个“很蠢的单位”。这些数字不宜当成严谨预测,却清楚暴露了OpenAI的需求模型:AI消费不会停留在人类阅读和输入的速度上,而会逐渐由持续工作的机器进程主导。
OpenAI公布的内部数据提供了一个现实缩影。到2026年6月,Codex已经贡献OpenAI内部99.8%的周度输出token;最重度的1%用户每天可以生成超过60小时的Agent工作量,因为他们同时运行多个任务。大量token并不是写出更长的回答,而是在购买并行执行、反复验证和更长的任务周期。OpenAI的统计显示,用户正在从一次调用一个模型,转向同时编排多条机器工作流。
这也是为什么模型效率提升未必会减少基础设施需求。更强的模型和更便宜的推理会降低一次任务的成本,却也会让原本不值得自动化的任务进入经济可行区间:过去只让AI写一段代码,未来可以让几十个Agent维护整套系统;过去只分析一份文件,未来可以持续监控整个行业。单位智能降价释放出更多需求,新增需求又消耗掉效率红利,这是一种典型的“杰文斯效应”。
OpenAI已经把这一逻辑写进自己的资本开支飞轮:基础设施改善模型能力并降低服务成本,更强的产品扩大使用量和收入,收入再投入下一轮算力建设。物理世界的数据也没有显示效率正在消灭能源需求。IEA最新基准情景预计,全球数据中心用电将从2025年的485TWh上升至2030年的950TWh,其中AI数据中心用电量将增长约两倍。约束正在从GPU本身向电网接入、发电设备、变压器、HBM、建设周期和资本供给扩散。
但这场演讲更值得注意的一句话,是Altman明确表示:OpenAI可以提供通用智能引擎,却不会、也不应该替各国和企业提供“context”。
这里的context不是一份更长的提示词,而是企业数据、业务规则、工具权限、身份系统、审批流程、历史经验和审计机制的组合。同样的模型接入不同的context,能够完成的工作完全不同。OpenAI在2026年6月的企业样本中发现,使用强度最高的前10%企业,每位活跃用户产生的输出token是中位企业的8.3倍,1月时这一差距还是2.6倍;OpenAI将差距主要归因于context、工具、培训和工作流重构,而不只是模型访问权限。
因此,Altman实际上为国家和企业划出了三层分工:能源与数据中心负责供应智能,模型公司提供通用能力,本地组织负责把智能转化为可执行的生产流程。一个国家可以选择自建或租用算力,也未必需要复制一家完整的前沿实验室;但如果连本地数据、Agent工作流、身份权限和评估体系都锁在外部平台上,那么所谓“主权”就只剩选择账单由谁支付。
这也是“AI像电力”这个比喻最容易误导的地方。电力输出相对标准化,而AI输出具有概率性;Agent获得工具和权限以后,错误还可能被自动放大。token增长既可能代表生产率提升,也可能只是更长的推理、更多失败重试和昂贵的无效劳动。OpenAI同日发布的《参与经济》因此主动修正了指标:应该衡量的不是token数量,而是扣除复核和返工之后,每一美元能够产生多少可靠成果。
未来几年,最重要的领先指标将不是模型榜单,也不是孤立的token增速,而是“单次成功结果成本”能否持续下降,同时Agent可可靠执行的任务周期是否继续延长。如果token消耗上升,却没有带来更高的成品率、更低的人工复核负担和可验证的收入或生产率,Altman的需求曲线就需要被下修。
反过来,一旦可靠性跨过临界点,效率提升和算力建设就不会互相替代,而会互相放大。届时AI产业的竞争核心,将从谁拥有更聪明的模型,扩展为谁能更便宜、更安全地把能源、算力与本地context转化为持续完成的工作。