OpenAI Astra核心架构爆出:大模型第三条Scaling法则诞生
循环深度通过在共享层上迭代,实现了“用计算深度换参数规模”的高效推理范式。它让模型能在输出下一个token前在潜在空间中多“想几遍”,显著提升复杂任务表现,同时降低内存与带宽成本。Geiping等人的Huginn等原型以及清华/字节最新的 SMELT 规模化研究,都从理论与工程上证明了其极高的可行性与算力节省潜力。这一方向可能成为未来推理模型的重要支柱,与文字CoT、参数扩展并行。
OpenAI Astra核心架构爆出:大模型第三条Scaling法则诞生
循环深度通过在共享层上迭代,实现了“用计算深度换参数规模”的高效推理范式。它让模型能在输出下一个token前在潜在空间中多“想几遍”,显著提升复杂任务表现,同时降低内存与带宽成本。Geiping等人的Huginn等原型以及清华/字节最新的 SMELT 规模化研究,都从理论与工程上证明了其极高的可行性与算力节省潜力。这一方向可能成为未来推理模型的重要支柱,与文字CoT、参数扩展并行。