展示HN: 通过GPU寄存器中的流体动力学修复光学计算抖动

Hacker News Top 工具

摘要

该仓库展示了一个概念验证,用于一个硬件原生的光学时序冻结控制平面引擎,该引擎利用GPU寄存器中的流体动力学建模来减少分布式AI架构中光学数据中心的抖动。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/16 06:41

PJHkorea/photonic-mesh-fng-router

源代码地址:https://github.com/PJHkorea/photonic-mesh-fng-router

photonic-mesh-fng-router(概念验证)

本仓库包含一个硬件原生、光学时延冻结控制平面引擎的概念验证(PoC)。本项目是一项初步探索,旨在尝试在不引入内存分配缓冲区的前提下,劫持硅光子加速器互联中的虚拟内存地址线。通过巧妙地将光学相移指标与多轴 jax.shard_map 结构以及跨流异步同步栅栏(fence)相结合,我们希望研究如何将机箱间的光子路由开销降至接近0纳秒。我们的方法重点在于绕过电光(E/O)缓冲延迟、消除动态编译图断裂,并帮助维持超大规模分布式AI架构(如 DeepSeek-V4/Megatron-LM-Optics)中精确的数值平衡。


🌊 架构哲学:从宏观到微观的光学难题

在下一代光学数据中心中,根本瓶颈似乎正从电气内存总线限制,转向由光收发器及光网络接口(ONI)热漂移引起的光传输抖动相位偏移失调。传统的通信协议栈通常依赖运行时循环分支(if/else)和重量级软件缓冲区来重新对齐延迟的光脉冲。然而,根据我们的观察,这种方法往往会导致加速器流多处理器(SM)内部产生昂贵的线程束分歧和流水线停顿。

photonic-mesh-fng-router 项目代表了一项探索性努力,旨在重新审视这一边界:

  • 可压缩光学涡旋场: 我们提议将光脉冲流建模为一个可压缩场,而非缓冲光包到达,利用局部线程束级别的洗牌寄存器(shuffle register)来解析波前延迟。
  • 动态寄存器扭曲: 该引擎尝试通过原生的1位谓词位动态映射底层虚拟寄存器空间,力图以最小的时序噪声适应光波的物理到达几何形状。
  • 无分支位运算: 利用纯无分支的位运算多路复用(MUX)操作(如内联的 selp 指令),我们正在尝试建立一个直接交错在超大规模LLM注意力路径中的、0字节零拷贝路由平面,巧妙隔离尾部通道变化以保护数值边界。

🧬 三层架构布局(核心模板)

为了精心解耦物理光学硬件时序与高级数值执行图,本仓库采用了一种三层分离式系统架构,旨在每个边界隔离异步遥测噪声。

(请注意,这是一个早期的研究原型。我们热切欢迎社区的任何反馈、修正或建议,以改进此设计并帮助完善我们的硬件协同设计假设。)


📊 架构流水线图

graph TD
    classDef ioNode fill:#1e293b,stroke:#475569,stroke-width:2px,color:#f8fafc;
    classDef cudaNode fill:#022c22,stroke:#0f766e,stroke-width:2px,color:#ccfbf1;
    classDef cppNode fill:#1e1b4b,stroke:#4338ca,stroke-width:2px,color:#e0e7ff;
    classDef pyNode fill:#062f4f,stroke:#0284c7,stroke-width:2px,color:#e0f2fe;

    IN["🌊 物理光学输入<br/>光波相位与光子互联<br/>(基于光学的 RoCEv2 / ONI)"]:::ioNode

    subgraph ENGINE ["⚙️ 三层分离控制平面 (PoC)"]
        L1["🛠️ 第1层:裸金属协同设计<br/>photonic_mesh_core_kernel.cu<br/>──────────────────────────────<br/>• 寄存器洗牌与位运算MUX抑制抖动<br/>• 无需JMP指令保护边界尾通道"]:::cudaNode
        L15["🔌 第1.5层:异步桥接<br/>photonic_bridge_wrapper.cpp<br/>──────────────────────────────<br/>• 通过显式释放所有权实现跨流同步栅栏<br/>• 屏蔽主机侧解释器及GC延迟噪声"]:::cppNode
        L2["🧠 第2层:拓扑治理<br/>photonic_fng_orchestrator.py<br/>──────────────────────────────<br/>• 跨节点的全局shard_map时序冻结<br/>• 形状对齐的多轴光学轨道重校准"]:::pyNode
    end

    OUT["⚡ 下游加速轨道<br/>超大规模LLM注意力矩阵<br/>(DeepSeek-V4 / Megatron-LM-Optics)"]:::ioNode

    IN --> |"原始光波流"| L1
    L1 --> |"抖动抑制寄存器"| L15
    L15 --> |"零拷贝DLPack张量"| L2
    L2 --> |"数值稳态"| OUT

    style ENGINE fill:#0f172a,stroke:#334155,stroke-width:1px,color:#94a3b8;

📊 验证与压力基准测试

我们提供了一个自动化脚本,用于验证该基础设施在极端环境下的结构稳定性和数值稳态。要将原生 C++/CUDA 共享库构建到您的本地包环境,并执行在模拟88%光路故障率下的50次迭代性能分析模拟,请调用:

pip install .
python -m photonic_mesh_fng_router.test_photonic_pipeline

预期输出将通过硬件隔离的CUDA事件时钟定时器确认零污染。


🧬 详细层级规范与子程序(PoC概述)

以下部分概述了我们对每个架构层级的早期探索性工作。我们热切欢迎社区的任何反馈或优化,以帮助夯实我们的硬件协同设计假设。

1. 第1层:裸金属光子内核(photonic_mesh_core_kernel.cu

此层代表了直接在硬件边界进行交互的实验性尝试:

  • 线程束洗牌相位对齐: 我们使用 __shfl_sync 内部函数在GPU寄存器边界进行操作。这是一种温和的方法,用于广播传入的光学令牌布局,同时尝试避免全局共享内存库的开销,在序列长度非均匀对齐时安全地保护边界尾通道免受数据损坏。

  • 谓词驱动的MUX抑制: 为缓解线程束分歧惩罚,我们正在尝试将对齐异常转换为原生的1位谓词位。通过将算术条件选择包装在内联的 selp.f32 汇编电路中,我们试图完全避免跳转指令:

    purified_output = pinn_branchless_select_f32(local_oni_fault, 0.0f, damped_wavefront)
    

    我们采用此硬件级方法的目标是测试,我们是否能够将光学相位抖动吸收至亚纳秒的ALU周期内,同时动态自适应调整流多处理器占用率因子。

2. 第1.5层:异步内存隧道(photonic_bridge_wrapper.cpp

此层处理物理硬件信号与高级执行图之间的脆弱桥梁:

  • 0字节指针拦截: 利用DLPack原语,我们尝试在模拟的光学网络接口(ONI)内存缓冲区与上层张量视图之间建立严格的零拷贝链接。我们明确避免主机侧的隐式内存重新分配或布局转换,温和地鼓励预对齐的内存布局以消除延迟气泡。
  • 异步生命周期栅栏: 我们将执行窗口封装在一个结合了原生Python GIL释放机制的跨流RAII硬件栅栏对象中。为优雅适应各种驱动运行时环境,引擎包含了一个显式的所有权转换(release())方案。我们希望这种方法能让我们研究,光子网络的时序是否能与高级Python垃圾回收(GC)延迟飙升安全隔离,而不触发无效句柄异常。

3. 第2层:异步治理塔(photonic_fng_orchestrator.py

此上层负责集群间的宏观协调:

  • 全局静态流形绑定: 我们提议通过映射到集群全局设备(jax.global_devices())的 jax.shard_map 来分片连续波场阵列。这是我们的初步尝试,旨在研究在启动时将光子网络的空间拓扑冻结在加速器的即时(AOT)缓存内,力图安全地扩展多主机环境的伸缩能力。
  • 光路断开稳态试验: 在发生关键光路中断或微环谐振器故障时,治理器被设计为捕获故障令牌。通过利用形状对齐的 jax.lax.all_gather 通信管线以及矩阵锁存器,引擎尝试立即广播令牌以保持执行链。我们希望研究此设计是否有助于保护分布式编译平面,免于昂贵的重编译周期或全局集群同步停顿。

📊 核心互锁与生态系统集成

本仓库旨在作为更广泛架构生态系统内的一个探索性宏观光子路由管道。我们持续测试其与以下组件接口和同步的能力:

  • fluidic-expert-fabric 我们正在探索将跨机箱RoCEv2动词转换为局部光波拓扑的方法,试图利用我们的无分支运行时猴子补丁路径优雅地绕过传统通信层。
  • Compressible-Vorticity-Autograd 一项持续进行的工作,旨在直接向无反向传播、仅前向的物理训练核心提供稳定的、抖动补偿的张量流形。通过在紧密的异步生命周期帧内绑定内存指针,我们希望检查在无垃圾回收干扰下的安全数据移交。
  • pim-hbm-bypass 一项研究工作,旨在确保集中式光学路由轨道与局部PIM-HBM逻辑芯片故障状态之间的实时对齐,温和地建立跨框架流同步,以保护原始内存边界免受时序错位噪声的影响。

🚀 快速开始:1行运行时注入

我们设计的 photonic-mesh-fng-router 是极简侵入式的。这是一项持续的努力,旨在消除在您的专有模型脚本中手动修改源代码的需求。相反,该引擎尝试在运行时通过低级执行钩子补丁运行中的编译器图。您可以尝试使用以下小型示例来体验该基础设施钩子:

import torch
from transformers import AutoModelForCausalLM
from photonic_mesh_fng_router import inject_photonic_fng_infrastructure_hook

# 1. 加载您的超大规模参数模型(例如 DeepSeek-V4)
#    请确保在运行前拥有足够的硬件资源。
model = AutoModelForCausalLM.from_pretrained(
    "deepseek-ai/DeepSeek-V4",
    torch_dtype=torch.bfloat16
)

# 2. 尝试将光学路由网络摄入编译平面
#    我们正在持续优化此钩子以实现接近0ns的开销并避免编译中断。
model = inject_photonic_fng_infrastructure_hook(
    model,
    topology_mode="SILICON_PHOTONICS_MESH",
    target_oni_stride=32
)

# 此钩子执行后,核心注意力层将尝试
# 直接与光学内存视图实现执行融合。

⚠️ 关于测试的谦逊说明: 这是一个早期研究原型(PoC)。虽然我们力求实现无缝的运行时注入,但建议首先在隔离的预发布环境中进行测试。如果您在初始化期间遇到任何意外行为,提供任何错误报告或日志我们将深表感激。

相似文章

Topology-Aware Data Movement for Disaggregated GPU Inference

arXiv cs.LG

This paper presents a topology-aware data movement orchestrator for disaggregated LLM inference, which dynamically selects optimal transport based on interconnect hierarchy and overlaps KV cache transfer with computation, achieving 3-18x transfer latency reduction over uniform RDMA.