深度研究Heat 88Quality 93

TEMPO:利用评论员校准突破大模型测试时训练性能瓶颈

TEMPO 提出了一种半监督强化学习框架,用于实现大型推理模型的可扩展测试时训练。通过交替运行的 EM 优化循环,该方法成功解决了传统自奖励机制中的奖励漂移与多样性崩溃难题。

AITest-Time TrainingReinforcement LearningLLMReasoning

核心结论

TEMPO 是一种用于大型推理模型(LRM)的半监督强化学习框架,旨在实现可扩展的测试时训练(Test-Time Training, TTT)[1]。该框架通过引入交替的期望最大化(EM)循环,克服了传统自奖励 TTT 方法容易陷入的奖励漂移与多样性崩溃问题,显著提升了模型在复杂推理任务中的表现[1][2]。

概念背景

大型推理模型在测试阶段通常依赖静态思维链(Chain-of-Thought)或自奖励测试时强化学习(如 TTRL)。然而,纯自奖励机制在缺乏外部地面真实信号(Ground Truth)约束时,往往会导致奖励模型逐渐偏离真实评估标准(即奖励漂移),并造成模型输出解法趋同(多样性崩溃),限制了性能的持续提升[1]。TEMPO 正是为了突破这一瓶颈而设计的半监督 TTT 方案[1][2]。

技术原理

TEMPO 将测试时训练表述为一个交替运行的 EM 优化循环,持续锚定模型的奖励信号:

  • E 步(评论员校准 / Critic Recalibration):利用少量带标注的锚定数据集及其可验证奖励,定期更新价值评论员模型(Value Critic),校准其对解法价值的评估能力[1]。
  • M 步(策略精炼 / Policy Refinement):利用校准后的评论员模型对无标签测试样本生成优势估计(Advantage Estimates),进而对演员策略(Actor Policy)进行参数更新[1][2]。

关键演进

在 AIME 2024 数学竞赛基准测试中,TEMPO 展现出了突出的性能增幅:

  • OLMo3-7B:pass@1 准确率从 33.0% 提升至 51.1%(增长 18.1 个百分点)[1]。
  • Qwen3-14B:pass@1 准确率从 42.3% 提升至 65.8%(增长 23.5 个百分点)[1][2]。

与传统自奖励方法在多步训练后性能迅速陷入平台期甚至退化不同,TEMPO 在超过 350 个训练步长中保持了性能增益,并成功维持了 pass@k 候选解法的多样性[1]。

实用价值

TEMPO 具备超越单一数学领域的泛化能力,能够平滑推广至 STEM 问题及逻辑谜题等非数学推理场景[1][2]。这种在推理阶段通过半监督持续微调模型的方法,为高难度推理任务的高效求解提供了新的范式。

风险与限制

  • 锚定数据依赖:需要预先准备小型且高度可靠的已标注锚定数据集以执行评论员校准[1]。
  • 计算开销高昂:在推理阶段动态更新模型参数会带来显著的计算延迟与算力消耗,明显高于标准推理或静态思维链提示[1][2]。
  • 超参数敏感:交替 EM 循环中的超参数对分布外(OOD)任务较为敏感,可能需要精细微调[1]。

参考来源

  1. TEMPO: Scaling Test-time Training for Large Reasoning Models - arXiv (2026-04-21)
  2. TEMPO: Scaling Test-time Training for Large Reasoning Models - Hugging Face (2026-04-22)