核心瓶颈与破题思路
随着 AI 集群由万卡向十万卡乃至百万卡演进,网络互联正成为与 GPU 算力同等关键的基础瓶颈。算力规模可以通过持续增加芯片数量实现扩展,但集群能否将物理算力转化为有效算力,最终取决于网络是否具备足够的带宽、并发能力与扩展效率。传统全连接架构,需要为大量通信关系分别维护序列号、传输窗口、重传计时器及拥塞控制参数等上下文状态。随着集群规模和通信并发持续增长,连接状态快速膨胀,大量消耗网卡片上资源,进而限制有效带宽与集群扩展能力,成为十万卡级 AI 集群释放算力的重要制约。凌波智芯率先推动"无链接 RoCE"技术实现产品化落地,通过将数据传输与细粒度连接状态解耦,显著降低超大规模并发通信带来的状态开销,从根本上缓解连接膨胀问题,让网络能力能够随集群规模持续扩展,真正为 AI 算力松绑。
