AI Infra Wiki
搜索
Search
暗色模式
亮色模式
探索
标签: training-system
此标签下有14条笔记。
2026年10月06日
RDMA over Ethernet for Distributed AI Training at Meta Scale
training
training-system
networking
communication
congestion-control
routing
infrastructure
2026年10月06日
Mixed Precision Training
training
quantization
gpu
memory
optimization
model
training-system
2026年10月06日
Optimizing the Parallelism of Communication and Computation in Distributed Training Platform
training
training-system
parallelism
communication
optimization
benchmark
2026年10月06日
TileLang DSL
kernel
infrastructure
training-system
2026年10月06日
Alibaba HPN: A Data Center Network for Large Language Model Training
training
training-system
llm
networking
topology
infrastructure
2026年10月02日
HAPMoE: Heterogeneity-Aware Automatic Parallelism for MoE Training
architecture
llm
moe
training
training-system
expert-parallelism
collective
distributed
parallelism
scheduling
throughput
2026年10月01日
Mixture-of-Kittens: MoE Megakernel for NVL72s
architecture
llm
moe
training
training-system
expert-parallelism
collective
gpu
nvidia
scale-up
interconnect
kernel
throughput
distributed
2026年9月22日
DSec Sandbox Platform
sandbox
training-system
inference-system
agentic-ai
2026年9月22日
DeepSeek DSec: 大规模 Agentic 训练沙箱基础设施
architecture
agentic-ai
training-system
distributed
storage
sandbox
infrastructure
virtualization
2026年9月14日
AI Infra Book Ch.10 Training System
book
training
training-system
collective
distributed
memory
2026年9月08日
CIERA: Cross-Iteration Exponent Reuse for Lossless Allgather in Sharded MoE Training
llm
training
moe
collective
communication
parallelism
gpu
nvidia
training-system
quantization
2026年9月08日
REACT: Tuning Collective Patterns to Alleviate Congestion in Shared AI Clusters
llm
training
collective
communication
congestion-control
fabric
scale-out
gpu
nvidia
training-system
2026年9月07日
BASP: Communication-Efficient Batch-Aware Sequence Parallelism for LLM Training
llm
training
parallelism
communication
attention
transformer
collective
gpu
nvidia
training-system
2026年9月07日
Einsummable: Automatic Multi-GPU Parallelism via Join-Agg Specs
llm
parallelism
communication
transformer
attention
gpu
nvidia
training-system
inference-system
optimization
collective