Nested Parallel von Neumann Architecture and Nested BSP
Author: Heng Liao Affiliation: Huawei Technologies Co., Ltd. arXiv: 2609.16787(2026-09-15,cs.DC/cs.AR;Wed 9/16 列表) PDF: arXiv PDF
把「百万处理器仍是一台计算机」写成两套嵌套玩偶:Nested BSP(软件)与 Nested Parallel von Neumann Architecture(硬件),由端到端 UnifiedBus (UB) 串起;与 LogicFolding 的 τ Scaling law 配对。
动机
- 规模 AI 不再是「更强单处理器」竞赛,而是如何让一支处理器军队仍服从一台机器的命令结构。
- 批判两点外推:(1) 把多台计算机联网就得到更大一台;(2) 几乎处处假设 master/slave(host>device、CPU>加速器)。
方案
- Nested BSP:经典 BSP 四步(并行工作 / barrier / exchange / aggregate)递归嵌套到每一层;硬约束——每层节点皆 peer。
- 硬件嵌套:CORE → chiplet → package → board → rack → SuperNode → data hall → autonomous zone。
- Unified Bus:memory-semantic、全路径同一协议;physically sparse, logically tight;近铜远光、协议不变。
- 文称 Huawei SuperNode 以 Nested BSP 为理论根基;τ 在系统层「折叠时间」,本架构「折叠并行层次」。
效果
论述/架构论文,无独立吞吐或硅测表。定量线索指向既有 τ 芯片(密度/功耗)与 UB 规范叙述;勿把本文当成基准数据源。
与 wiki 的关系
- UnifiedBus (UB) — 文中 interconnect 本体
- AI Infra Supernode — SuperNode / 自治区层次
- Huawei τ Chip — τ Scaling law 配对
- Constraint-Driven AI Infra Design — 「一台计算机」约束叙事
- Interconnection Network Design Space — 协议/拓扑设计空间对照
- NVLink fabric — 另一条「域内一台机」产品路径
开放问题
- Nested BSP 各层 barrier/exchange 的可测延迟界与失败模型。
- peer equality 与现有 host-driven 软件栈的迁移成本。
- 与 NVLink/UALink 域的对照应落在哪些可复现指标上。
Citations
[1] arXiv PDF — Liao, arXiv:2609.16787 [2] nested-parallel-von-neumann-nested-bsp.md — ingest stub