铭鸿体育资讯网

2026年8月6日,AMD宣布收购AI推理初创公司Taalas。该公司采取了一种激进的技术路径,“以牺牲通用性换取极致性能”。 与通用的GPU不同,Taalas将特定AI模型的权重和结构直接“烧录”进芯片,而非依赖外部内存读取。 也就是说Taalas芯片专为某一特定AI模型定制,通过将模型参数固化在芯片中,大幅减少 ​

2026年8月6日,AMD宣布收购AI推理初创公司Taalas。该公司采取了一种激进的技术路径,“以牺牲通用性换取极致性能”。

与通用的GPU不同,Taalas将特定AI模型的权重和结构直接“烧录”进芯片,而非依赖外部内存读取。
也就是说Taalas芯片专为某一特定AI模型定制,通过将模型参数固化在芯片中,大幅减少数据搬运,从而实现超高速推理。
惊人的性能数据
其首款测试芯片HC1(采用6nm工艺,针对Llama 3.1 8B模型定制)在基准测试中实现了每秒16960个Token的生成速度,据称比英伟达最新的Blackwell架构GPU快48倍,是英伟达H200的73倍。
图片单用户吞吐量(Tokens/每秒)
该芯片的功耗约为实现同等性能的GPU功耗的1/10。
Taalas声称其芯片的制造成本比基于GPU的推理基础设施低20倍。
运行成本低至每百万Token是经过优化的同等GPU约1/20。
无需液冷,并将服务器机架密度提升了10倍。
具备即插即用功能,内置模型即开即用,将部署时间从数月缩短至数分钟,降低了采用门槛。
其CEO表示,从拿到一个新模型到完成硬件定制,仅需约两个月时间。
Taalas的终极目标是打造一个无需高带宽内存(HBM)、3D堆叠、先进封装和液冷即可运行的推理系统,从根本上降低成本和功耗。
Taalas借鉴了2000年代初期结构化ASIC(专用集成电路)的概念。
Taalas并非完全定制化的ASIC(这种做法成本太高),而是仅定制其芯片设计100多层中的两层。这两层承载着模型的权重。
图片被永久固化为芯片电路的Llama 3.1 8B模型
Taalas表示,单颗HC1芯片可容纳完整的80亿参数Llama模型,未来的芯片代际(HC2)计划在2026年中瞄准200亿参数模型,并在2026年底前支持前沿规模的大语言模型。
最大的局限就是Taalas缺乏灵活性,一旦模型架构发生重大变化,就需要重新定制芯片,无法通过软件升级解决。
Taalas通过“两月转化流水线”和激进定价策略来应对这一局限。为新型号重新定制Taalas芯片的成本,只有训练模型所花费的数十亿美元的1/100。
Taalas尤其适合模型架构相对稳定、推理规模极大的场景,以及高吞吐、低延迟的实时AI应用,边缘计算与私有化部署,或用于大型模型的加速等等。
AMD的规划是让Taalas芯片与Instinct GPU协同工作,由GPU负责通用计算,Taalas芯片承担特定高频推理任务。