CODE PLAN: Scaling Code-Form Planning for LLM Reasoning
Authors: Jiaxin Wen, Jian Guan, Hongning Wang, Wei Wu, Minlie Huang | Affiliations: Tsinghua University, Ant Group | PDF: Code_Form_Planning_Scaling_LLM_Reasoning_2024.pdf
一句话总结
CODE PLAN 让 LLM 先生成并遵循 code-form 伪代码计划再作答;从海量语料自动抽取 2M ⟨prompt, plan, response⟩ 训练,在 13 个多步推理基准上相对直接生成平均 +25.1%,复杂任务增益更大。
核心贡献
- Code-form plan IR:函数调用、循环、条件分支显式编码推理结构 — 可解释且跨域通用
- Scalable auto-mining:无需任务专用标注,从开放语料提取 planning signal
- 2M 规模数据集:prompt + code plan + response 三元组监督
- vs CoT / Plan-and-Solve / latent plans:兼顾 expressiveness(结构+通用+可解释)与 learning efficiency
- Complexity scaling:任务越复杂,plan 中间表示收益越显著
关键数字
| 设置 | 结果 |
|---|---|
| Training examples | 2M |
| Benchmarks | 13 (math, symbolic, IF, multi-hop QA, decision) |
| Relative improvement vs no plan | 25.1% avg |
| Backbone scale | 7B–13B (Mistral, Llama) |
与 wiki 交叉引用
- Prefill Decode Divergence — 长 chain-of-thought/plan 拉长 prefill 与 decode
- Inference Capacity Trap — 多步 reasoning 增加 token 与 KV 占用
- Heterogeneous Inference — agent/reasoning 工作负载 placement
- vLLM — 长上下文 plan+response 的 KV 管理
- Disaggregated Inference — reasoning-heavy 流量与 serving 架构
Citations
[1] Code_Form_Planning_Scaling_LLM_Reasoning_2024.pdf — Wen et al. (2024) [2] code-form-planning-llm-reasoning.md — 结构化摘录