技术介绍
无链接 RoCE 架构——专注十万卡 AI 集群网络互联
凌波智芯专注于 AI 算力网络底层技术创新,研发主航道聚焦于"无链接 RoCE"架构 AI 网卡及拥塞控制以及重传等技术,面向大模型训练与推理以及未来十万卡级智算集群,构建高性能、自主可控的网络互联底座。 公司率先推动无链接 RoCE 技术实现产品化落地,通过重构网卡内部的连接管理机制,将数据传输与细粒度连接状态解耦,使网卡无需再为每一个通信请求独立维护序列号、传输窗口、重传计时器和拥塞控制参数等上下文信息。 这一架构能够显著降低连接状态对片上存储和硬件资源的占用,避免连接数量随集群规模和通信并发快速膨胀,从根本上缓解传统全链接架构在超大规模 AI 集群中面临的连接状态爆炸、有效带宽折损和并发扩展受限等问题。 在此基础上,凌波智芯结合拥塞控制与快速重传等关键技术,持续提升网络带宽利用率、传输稳定性和集群扩展能力,真正为 GPU 算力松绑,为国产十万卡级智算集群提供高效、可靠、开放兼容的互联能力。
凌波智芯围绕十万卡级 AI 集群的高性能互联需求,构建了以无链接 RoCE 架构为核心,HP4 智流控与 SSR 极速重传为关键支撑的技术路线,系统解决超大规模集群中的拥塞、丢包、重传与带宽利用率下降等问题。 HP4 流控技术是凌波智芯自研的拥塞控制方案。传统网络通常需要等待拥塞发生并收到反馈后,再动态降低发送速率,容易产生队列堆积、丢包和带宽震荡。HP4 则使数据流在进入网络之初,便以接近"无拥塞且可充分利用带宽"的临界速率发送,将拥塞控制从事后反馈调整转变为主动调度。HP4 可在不修改现有网卡与交换机的条件下部署,能够降低突发流量对网络的冲击,减少队列堆积和拥塞扩散,并持续提升开放以太网环境下的有效带宽利用率。在十万卡规模集群仿真中,HP4 展现出良好的大规模扩展能力和流量调度稳定性。 SSR 极速重传技术主要面向 AI 集群中的丢包恢复与尾时延问题。传统网卡在发生丢包后,通常需要重新从主机内存读取待重传数据,数据访问路径长、恢复时延高,同时需要维护大量重传状态。 SSR 通过网卡侧本地缓存与快速拉取机制,使丢失的数据包能够优先从网卡本地快速恢复,避免频繁访问主机内存,大幅缩短重传路径。同时,SSR 通过精简重传状态和优化丢包判定机制,降低网卡硬件资源开销,提升高并发通信场景下的可靠传输能力。 通过 HP4 对拥塞的主动预防,以及 SSR 对丢包的极速恢复,凌波智芯形成了覆盖"拥塞前控制—传输中调度—丢包后恢复"的完整传输优化体系,为十万卡级 AI 集群提供高带宽、低时延、高可靠的网络互联能力。
性能优势
凌波智芯通过首创的无链接RoCE架构和HP4与SSR核心技术,实现支持10万卡以上规模的AI集群互联,有效带宽利用率98%,并发QP 100K,丢包重传时延8us,AllReduce完成时间3.4ms。
成本优势
凌波智芯通过核心 IP 自研、芯片架构优化与供应链协同,持续降低产品物料与制造成本。在规模化流片和量产条件下,预计单颗芯片 BOM 成本可控制在约 2,000 元人民币,为产品形成显著的成本竞争力,并为后续定价策略、市场拓展及毛利空间提供有力支撑。