AI Infra Wiki
搜索
Search
暗色模式
亮色模式
探索
标签: optimization
此标签下有25条笔记。
2026年10月06日
Fovea: Physical-Implication-Aware Wafer-Scale DSE
wse
now
network-on-wafer
noc
interconnect
chiplet
packaging
architecture
training
llm
optimization
2026年10月06日
Understanding Silent Data Corruptions in a Large Production CPU Population
cpu
infrastructure
benchmark
optimization
2026年10月06日
PANDA: Adaptive Prefetching and Decentralized Scheduling for Dataflow Architectures
accelerator
dataflow
scheduling
spatial-execution
memory
cache
optimization
2026年10月06日
M5: Mastering Page Migration and Memory Management for CXL-based Tiered Memory Systems
memory
cache
virtualization
infrastructure
optimization
2026年10月06日
Mixed Precision Training
training
quantization
gpu
memory
optimization
model
training-system
2026年10月06日
Optimizing the Parallelism of Communication and Computation in Distributed Training Platform
training
training-system
parallelism
communication
optimization
benchmark
2026年10月06日
Multi-Branch Self-Drafting for LLM Inference Acceleration
inference
decode
llm
optimization
serving
transformer
2026年10月06日
HyperMR: Efficient Hypergraph-enhanced Matrix Storage on Compute-in-Memory Architecture
memory
accelerator
hardware
sparse
optimization
kernel
2026年10月06日
CosMoS: Architectural Support for Cost-Effective Data Movement in a Disaggregated Memory Systems
memory
virtualization
infrastructure
optimization
scheduling
2026年10月06日
FlexInfer: Flexible On-Device LLM Offloading
inference
memory
optimization
llm
storage
latency
2026年10月06日
DynaX: Dynamic X:M Sparse Attention Acceleration
attention
sparse
accelerator
optimization
transformer
llm
kernel
hardware
2026年10月06日
Cache-Resident LLM Inference in GB-Scale LLCs
inference
cache
cpu
memory
llm
kv-cache
parallelism
optimization
2026年10月06日
Heterogeneous Computing for AI Agent Inference
agentic-ai
ai-agent
inference
llm
memory
accelerator
memory-bandwidth
optimization
2026年10月06日
CODE PLAN: Scaling Code-Form Planning for LLM Reasoning
reasoning
llm
training
model
optimization
2026年10月06日
Muon Optimizer
optimization
training
2026年10月06日
Manifold-Constrained Hyper-Connections (mHC)
architecture
optimization
training
2026年9月15日
RoofLang: Enabling AI-Driven Architecting of LLM Inference Systems
inference
serving-system
llm
decode
prefill
kv-cache
moe
deepseek
nvidia
architecture
optimization
parallelism
throughput
latency
batching
distributed
scale-up
2026年9月14日
AI Infra Book Ch.5 Operators and Runtime
book
compiler
scheduling
kernel
gpu
optimization
2026年9月14日
Fengshui: Chiplet Ecosystem and Bespoke Accelerator Codesign
chiplet
packaging
accelerator
llm
moe
inference
architecture
parallelism
memory
optimization
2026年9月07日
CREDIT: Cost-guided Reduction-reuse with Efficient DSMEM Inter-CTA Tiling
gpu
nvidia
architecture
memory
kernel
optimization
communication
interconnect
noc
throughput
2026年9月07日
Einsummable: Automatic Multi-GPU Parallelism via Join-Agg Specs
llm
parallelism
communication
transformer
attention
gpu
nvidia
training-system
inference-system
optimization
collective
2026年7月30日
Attention Residuals
attention
llm
architecture
moonshot
residual
optimization
2026年7月30日
Linear Attention Evolution
attention
llm
transformer
architecture
model
moonshot
inference
optimization
2026年7月30日
Stable Latent MoE
moe
llm
moonshot
architecture
routing
optimization
kernel
2026年7月17日
Mixed Precision Training
training
quantization
llm
optimization
nvidia
gpu