王兴军教授课题组
首页 研究方向 课题组成员 科研成果 组内动态 加入我们 English

联系方式

王兴军教授邮箱:xjwang@pku.edu.cn

王晓红助理邮箱:xhwang@pku.edu.cn

相关链接

中心在 National Science Review 发表片上全光互连加速神经网络推理研究成果

2026年5月19日,中心在 National Science Review 在线发表论文“On-chip large-scale all-optical interconnect for ultra-low-latency deep neural network inference”。研究提出基于片上全光超节点的光电融合分布式计算系统,通过硅光收发芯片和光交换芯片连接多个计算节点,在五层卷积神经网络图像去噪任务中验证了低时延流水并行推理。该文收录于期刊“光电融合”专题。

随着人工智能模型规模扩大,计算系统不仅需要更多算力,也需要更高效地传递数据。多个计算芯片协同工作时,节点间带宽、数据搬移和等待时间会影响算力利用率。光互连能够提供高速数据通道,但要将这一优势转化为分布式计算性能,还需要低损耗、可重构的交换网络,以及与之匹配的数据调度方式。

中心将 400 Gb/s 硅光收发芯片与 16×16 非阻塞光交换芯片结合,构建可重构的全光连接。光交换芯片在 1300 nm 附近实现不高于 5 dB 的总损耗,降低了链路对额外光放大的需求。在所测试的 20 条交换路径中,系统在启用前向纠错的条件下均实现无误码传输,为多个计算节点之间的数据交换提供了稳定连接。这里的“全光”指节点之间的互连与交换,神经网络计算仍由 FPGA 完成。


图1 基于片上全光超节点的光电融合分布式计算系统示意图

在系统验证中,研究人员将五层卷积神经网络的各层分别部署在五块 FPGA 上,再将光交换网络配置为流水并行结构。上一层的结果通过光互连直接送往下一计算节点,使不同层能够同时处理连续输入的数据。系统对 1000 幅 32×32 像素、每像素采用 32 位浮点表示的图像完成去噪推理,总耗时为 105.16 μs。

在论文采用的相同任务和 FP32 精度下,单 GPU 基线耗时为 15.643 ms,约为该系统的 149 倍;论文估算的 FPGA 已部署计算资源峰值算力为 1.96875 TFLOPS,约为 GPU 基线 16.96 TFLOPS 的 11.6%。这一对比反映了所测试的小规模卷积网络及实现方式下的结果,说明合理组织互连和流水计算可以提高计算资源利用率。

该研究为利用光互连组织多个计算芯片提供了可验证的系统方案。后续通过改进 FPGA 实现、扩展网络规模及提高光电接口速率,可进一步研究其在更复杂推理任务中的适用性。陶子涵、周䶮、虞潍榛、常华瑾为论文共同第一作者,舒浩文、王兴军为共同通讯作者,北京大学为主要完成单位。

论文原文:https://doi.org/10.1093/nsr/nwag282






发表日期:2026年05月19日