Anthropic Matt:思考不是开关,是旋钮——Test Time Compute 详解
Source: (unknown)
Summary
Anthropic 研究员 Matt Blyfer 在 Code with Claude 大会上讲解推理时计算扩展(Test Time Compute)的原理与实践。核心主张:让模型花更多 token 思考,可以在同一模型上持续提升输出质量,就像训练时扩大算力一样。他将 Claude 可用的 token 分为三类:thinking tokens(内部推理)、tool calling tokens(与环境交互)、text tokens(与用户交互),并以交通模拟为例展示了 low/high/max effort 下输出质量的显著差异。Claude Code 的默认档位已调至最高,用户可通过 Effort Dial 而非简单的开/关思考来精细控制算力投入。
Key Points
- Test Time Compute:允许模型在推理阶段花更多时间(token)处理问题,与训练时扩大算力类比
- 三类 token:thinking tokens(内部推理链)、tool calling tokens(调用工具/读写文件)、text tokens(输出给用户)
- Effort Dial 而非 Thinking Toggle:思考是旋钮不是开关,可从 low → high → max 连续调节
- 交通模拟 demo:low effort 约 4600 token,max effort 消耗 10 倍 token,输出质量(画面、驾驶逻辑)显著提升
- Claude Code 默认已设为最高档;多花 token 换更好结果在 agentic coding、学术推理、computer use 等任务上均成立
- 未来方向:Claude 将可以花费数天乃至数月 token 解决人类最难的挑战
Transcript
transcript