都知道中科曙光的scaleFabric很强,它其实就是国产InfiniBand,原生的无损RDMA高速网络。但它究竟强在哪?我看好多人在讨论的都是一些表面上的内容。
正好今天中科曙光发布Token加速技术体系,借着这个事跟大家唠唠。这套技术体系是一系列基于scaleFabric做的算存传协同优化,里面每项技术单拉出来都很能打。比如其中的IBGDA技术,已经在十万卡级大规模集群里完成验证,也是这项前沿技术在国内首次规模落地。
要知道,技术发布和规模化落地是两码事。很多技术在实验室跑得挺好,一上大规模集群就各种问题。链路抖动、拥塞控制、负载均衡,哪个环节出问题都能让整个集群停摆。而IBGDA让GPU自己驱动网卡、绕过CPU发指令,在十万卡规模下做稳定,涉及驱动适配、集群配置、跟DeepEP框架的协同,难度不是一般的大。
过去几年行业讲算力焦虑,现在越来越多人意识到真正的瓶颈在互联效率和系统协同。中金公司最近的研报也提到,AI基础设施瓶颈正由单芯片算力转向互联效率、资源调度和系统协同。scaleFabric能在十万卡级完成验证,说明国产智算网络开始接受真正的规模化考验了,能把技术从实验室搬到十万卡集群稳定跑起来,我觉得这个意义要比这次技术发布本身更大。
AI 算力 中科曙光 国产IB
