第四部分 · 推理与测试时算力
第四部分 · 推理与测试时算力
「生成一条思维链,会显著提升大语言模型处理复杂推理的能力。」
Jason Wei 等,"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models"
推理最容易被说成一种神秘能力,仿佛模型内部突然多了某个专门机制。这一部分换一个更有用的角度:推理就是在答案确定之前额外投入的计算。这笔计算花在模型作答时而非训练时,正是标题所说的测试时算力。这份计算可以放在提示里,可以组织成搜索,可以交给程序、求解器或证明检查器,可以通过训练变成习惯,也可以留到推断时,靠采样、验证、分支和难度路由来挑出更稳的结果。
第 24 章 先从最小动作讲起:给模型留下思考空间,不再把单次采样当作最终答案。第 25 章 接着把控制问题显式化:链是一条路径,树保留备选,图复用局部工作。第 26 章 把推理拆成翻译与执行:模型写出程序、查询、符号链或证明脚本,外部运行时计算或检查它。第 27 章 则研究验证器本身,从单元测试和答案检查器,到过程奖励模型和生成式验证器。
第 28 章 把这笔成本移进训练,用可验证奖励(来自能被自动检查的答案的奖励信号)和强化学习,把有用推理变成更稳定的行为。第 29 章 把轨迹当作数据:自生成 rationale、拒绝采样、小而精的数据集、蒸馏,以及 long-to-short 迁移。第 30 章 再把测试时算力当作一项预算,讨论并行尝试、顺序修订、验证、按难度路由,以及生产里的过度思考问题。
判断任何推理主张时,先问四个具体问题:额外计算投入在哪里,谁在检查它,什么数据记录它,收益来自覆盖更多可能答案,还是来自挑出更好的答案。这样一来,提示方法、推理训练和测试时扩展就不再混为一谈。
评论
登录后评论