Arch-Study 30d Knowledge Map(30 天知识地图)

arch-study Day 30:不读新教材——把 Day 1–29 收束成地图、根问题与公式清单。完整笔记:arch-study-30d-day-30.md

五阶段脉络

阶段Days锚点概念(wiki)
① 量化基础1–7Quantitative Architecture Fundamentals
② 现代 CPU8–16CPU PipelineOoOBranch PredictionCacheTLB
③ 存储17–22DRAMCoherenceNoC FundamentalsEnd-to-End Memory Path
④ 并行23–27SMTGPU SIMTSystolic DSAWSE QuantLLM Collectives
⑤ 研究28–30Paper ReadingPost-Moore、本页
量化基础 → CPU 核心 → 存储/NoC → 并行(GPU/DSA/WSE/分布式)
                                    ↓
                         后摩尔:DSA × Packaging × Novel

五个根问题

  1. 性能从哪来?IC × CPI × T;三因子互锁(频率↔分支惩罚、并行↔通信)
  2. 瓶颈在哪? — Roofline + Amdahl;WSE Ridge≈6 → decode 偏 memory
  3. 数据怎么搬? — 层次延迟差数量级;片上 PB/s vs 片外 TB/s
  4. 并行怎么排? — ILP/DLP/TLP + 流水/重叠;WSE「反传统武器」换海量 PE
  5. 怎么评价? — 公平 / 透明 / 可复现(同工艺、同预算、报告 tail 与敏感度)

十大公式速查

#公式场景
1CPU Time = IC × CPI × T任意性能
2Speedup = 1/((1−f)+f/S)优化决策
3P = αCV²f功耗
4AMAT = Hit + Miss×Penalty存储层次
5CPI = Σ freq×cpiISA/微架构
6Yield = e^(−D₀A)良率/WSE
7Attainable = min(Peak, BW×AI)Roofline
8Ridge = Peak/BW瓶颈判定
9B_bisect = n(n×n Mesh)NoC 拓扑
10t_msg ≈ L/B + H×t_hop网络延迟

研究衔接(示例)

方向地图位置
WSEDay 26 量化 + Day 27 跨 wafer + Day 28 Reduce 论文
NoCDay 21–22 + Day 29 光/可重构/demand-aware
NPUDay 25 脉动/数据流 + Day 29 稀疏/混合精度
LLM 系统Day 27 集体通信 + Prefill/Decode 分歧

相关页面

Citations

[1] arch-study-30d-day-30.md — 总复习与知识地图(Day 30)