铭鸿体育资讯网

OpenAI 发布了他们自研的芯片,而且直接击败了英伟达、AMD 和谷歌所有可比可测芯片的推理 ASIC。 感觉 AI 领域的竞争已经到了下一个阶段: 现在大家除了拼模型能力以外,也在拼成本以及整个供应链的整合。 这款芯片专为大语言模型推理从零设计,从 2024 年中开始设计到流片只用了 16 个月。 它是通 ​

OpenAI 发布了他们自研的芯片,而且直接击败了英伟达、AMD 和谷歌所有可比可测芯片的推理 ASIC。

感觉 AI 领域的竞争已经到了下一个阶段: 现在大家除了拼模型能力以外,也在拼成本以及整个供应链的整合。

这款芯片专为大语言模型推理从零设计,从 2024 年中开始设计到流片只用了 16 个月。

它是通用的推理芯片,并非只能跑 OpenAI 自己的模型。在文章展示中,他们测试了 DeepSeek R1 以及 Kimi 2.5 的推理效率,可以跑各种模型和工作负载,甚至能跑 Doom 游戏。

目前该芯片只有工程样品,量产爬坡会在 2027 年开始,大部分产能预计在明年年底铺开。

这款芯片专门针对每瓦性能(能效比)进行设计。因为当前数据中心的核心瓶颈是电力,而非预算或占地面积,所以它必须在极低功耗下实现尽可能高的推理效率。

它的每瓦吞吐量全面碾压英伟达的 Blackwell,甚至超过了采用 HBM4 的 Rubin:

DeepSeek R1 超过 700 token/s/用户GPT OSS 超过 1400 token/s/用户Kimi 2.5 接近 700 token/s/用户

值得一提的是,OpenAI 尚未发布的 Astra AI 模型也深度参与了这款芯片的设计,这或许是它拥有极高能效且开发周期极短的关键原因。

芯片团队通过 Codex 和 GPT Astro,在两个月内把三个原本不在生产计划内的开源模型优化到了最高性能;AI 生成的部分模块比人类专家编写的模块还要快 1.5 到 1.8 倍。

颇具讽刺意味的是,跑在英伟达 GPU 上的 OpenAI 模型,正在帮助设计旨在击破英伟达 CUDA 护城河的芯片。

OpenAI 的下一个目标是达到 100MW 的部署规模,并计划于今年年底开始在自家的基础设施中正式部署该芯片。