铭鸿体育资讯网

200 tokens一秒是什么概念?你眨一下眼,它已经把一段文案的开头敲完了。

200 tokens一秒是什么概念?你眨一下眼,它已经把一段文案的开头敲完了。

智谱今天直接上线GLM-5.3-FlashX,没开发布会,推理速度最高拉到200 tokens/s,而这次提速的地基,是10万张国产芯片。外面的算力账单还在飞涨,国内的推理底座已经悄悄铺开了。

这模型之前以Ox Alpha之名在全球开发者圈跑了一圈,调用量一路涨,海外团队也在用。需求大了,智谱的解法不是限流提价,而是死磕Infra侧的优化:速度提上去,价格不动,智能水平还是同尺寸里最能打的。

智能、价格、速度,过去是一道三选二的权衡题,现在被它直接全占了。

对开发者来说体感最直观:流式输出不再一格一格蹦字,产品端那种丝滑,就是留存率实打实的加分项。API已经上线,Model Key就叫GLM-5.3-FlashX,文档和体验中心都是现成的,几分钟就能接进自己的项目。