Anthropic Claude Code 团队的 Thariq Shihipar 的这篇文章讲 Claude Code 里的 effort 设置(可以理解为投入档位)该怎么用。我想很多人都不是很清楚 Claude Code 的 effort 档位怎么选,我在看这篇文章之前也有些模糊,一般默认就是 high,现在看还是有些讲究的。 Thariq 的经验是:low 用于头脑风暴、画草图、小改动,要的是快,随时能插手;medium 用于大部分日常开发,比如实现新功能;high 用于需要验证、边界情况多的活,比如在老代码库里修 bug;max 用于让 Claude 完全自主攻克难题,比如从头到尾搭一个 App 并验证,或者给关键软件找安全漏洞。 在 Claude Code 里输入 /effort 就能切换档位,对话中途也可以换。注意只有最新的 Opus 5.5 和 Fable 5.1 不会让缓存失效,早期模型会让缓存失效。 Thariq 通过实测发现,effort 主要决定 Claude 在一个任务上花多少功夫做验证、测边界情况,以及替你拿多少主意。 effort 从 low 到 max 分几档,本质是告诉模型你愿意让它在这件事上花多少算力。同一件事,给你 1 小时,你会先交一个能用的版本,等对方反馈再改;给你 12 小时,你会自己反复打磨、检查。 最新的 Opus 5.5 和 Fable 5.1 可以在对话中途切换档位,而且不会让提示词缓存(prompt cache)失效,前面对话积累的缓存照样能用。能随时切了,很多用户就来问他到底什么时候该用哪一档。 【日常开发:需求越模糊,档位差别越大】 Thariq 让 Opus 5.5 用不同档位做同一个模糊需求:“做一个健身记录 App”。low 档只做出一个记录表和一张简单图表,档位越高功能越多,max 档还加了一张热力图。另一个任务是重新设计 Claude Code 的 /config 菜单,low 档 1 分钟交出一个能看懂思路的交互草图;max 档用了 28 分钟,样稿跟 Claude Code 真实界面很像,还附了几种操作流程的演示。 如果先让 Claude 详细采访他、整理出完整需求再动手,不同模型、不同档位的产出就很接近了。 换句话说,档位越高,Claude 替你做的假设越多。想自己掌控细节,就用低档位快速出初稿,边看边改。 他现在开发新功能的流程是:把需求交给 Claude,让它反过来问你还漏了哪些细节;用 low 档实现,检查大方向对不对,不对就继续用 low 档改;最后切到 high 档做验证和测试。 【难题:高档位用来补边界情况】 更难的任务,他去翻了 Terminal-Bench 3.0 的结果。这是一个社区出题的基准测试,题目比日常开发难得多,比如用 Verilog 写一台能装进小型 FPGA(可编程芯片)的 8 位游戏机,或者在定理证明工具 Lean 4 里完整证明一条数学定理。 他的主要结论是:边界情况越多的任务,越值得开高档位。 html-js-filter 这道题要求写一个 HTML 过滤器,把所有往网页里夹带 JavaScript 的写法都清理干净。Fable 5.1 在 low 档跑 5 次只过了 1 次,到 xhigh 档 5 次全过。low 档每次两分钟左右,写一遍过滤器,拿一个手写页面测一下就结束了。他追踪的一次 high 档运行花了约 33 分钟:先挑自己初稿的毛病,再去读解析器源码找 bug,跑了一套标准的 XSS(跨站脚本攻击)测试集,最后还写了一个随机生成网页的模糊测试程序。 Opus 5.5 修存储引擎崩溃 bug 的题也类似,low 档 0/5,xhigh 档 4/5。low 档一分钟左右就直接改代码,没先复现崩溃;xhigh 档花 11 分钟,先复现,再写随机测试,还专门确认修到一半的代码会被测试拦下来。 按领域看,硬件、代码审查、安全这类题目从高档位受益最多。但档位也有管不到的地方:加档位能减少因漏掉边界情况导致的失败,模型一开始思路就错了的话,档位开再高也救不回来。 还有一道题能看出人在不在场的区别。gsea-proteomics 要求分析一组蛋白质组学数据,判断八种处理方式里哪些效果接近目标组织。low 档的 Opus 5.5 挑了一种听起来合理的数据预处理方法,跑一遍就报结果,5 次全错;high 档试了两种预处理方法,发现得出的结论不一样,先查清原因再选定方法,5 次对了 4 次。Thariq 说,如果有人在场,Claude 可能会先问一句这个问题该怎么设定;没人在场,高档位的效果更好。 所以档位怎么选,很大程度上看你打算在这个任务里参与多少。一直默认开 high,等于每次都让 Claude 替你多拿主意,也每次都多花时间和 Token。
What is effort really? When do you change it it and why not just use max effort for everything? I dove deep into this problem, looking into evals and doing my own tests and I was quite surprised by the results.
Article

Using Claude Code: Spending your effort

One of the best parts of our newest Claude models is how they respond to effort without breaking the prompt cache in Claude Code, but I’ve received a lot of questions on this from users. What is

Last edited Sep 26, 2026 · 2:52 AM UTC

30
49
296
63,576
Sort replies: Relevant Recent Liked
Replying to @dotey
effort这种设计本身就是过时的,无论是省token还是任务复杂度,下一代应该是交给模型决策
5
211
Replying to @dotey
总结版
2
465
Replying to @dotey
我一般默认用的是 xhigh,有时候确实感觉浪费了 尤其是改点小东西 走个发布流程
1
500
Replying to @dotey
很清晰,最近研究Claude官方的提示词指导,里面也提到档位了,真的不是所有的任务都用高档位,还是要自己有一定的判断能力,想让他少想一点,就降档。下面是我写的解析官方提示词指导的文章,也可以看看。
77
Replying to @dotey
这篇我认真看了。我平时写 skill 基本无脑开 high,总觉得越高越稳妥。 结果数据说规则手册式的活儿加档位提升很小,真正被拉开的是安全和硬件这种边界情况多的题。 现在我会先 low 跑一轮看方向对不对,方向错了,开 max 也只是把错的方案磨得更精致。
54
Replying to @dotey
出方案/设计文档的时候开高。 开始实施,单元测试的时候开中。 开始 Review 提交的时候开高。 这个策略行吗! 能让 Jev 选估计能更好。
147
Replying to @dotey
这是第一次看到清洗的解释,effort原来和任务复杂度相关;所以并不是小任务开个 xhigh就一定比 medium 做的好
1
247
Replying to @dotey
这篇实测最值得迁移的,不是“默认开 high”,而是把 effort 当成验证预算:需求模糊时先用 low 快速暴露方向,边界多、需要独立检查时再升档。实际评估还应把成功率、耗时和 token 成本放在同一张曲线上;高档位能补漏测,救不了错误的任务建模。
294
Replying to @dotey
中途切档在旧模型上会让缓存失效,长上下文里这一次重读的代价可能超过省下的 token。所以切换的价值在短对话,长任务不如一开始就选对档位。
372
Replying to @dotey
我也一直开 high 原来是在烧 token 换它多拿主意
18
Replying to @dotey
这档位终于讲明白了,我真松了口气。小改动开 low,老代码修 bug 再上 high;全程默认 high,慢不说,还白烧算力。
1
1
29
Replying to @dotey
档位调低省的是钱还是时间 你试过 low 和 high 的实际差距吗
1
197
Replying to @dotey
effort 档位这块我的经验是:跑惯 high 之后反而容易忘掉 low 的存在。长任务拆步骤时,大部分子任务(批量重命名、写测试脚手架)low 完全够用,high 留给架构决策;全档位 high 等于拿烧钱的慢模型干杂活 😂
1
155
Replying to @dotey
gpt可以取消了,直接掉档位都够用了
64
Replying to @dotey
他应该加一个智能路由功能
160
Replying to @dotey
省流:小活别开太高,复杂任务、容易翻车的地方再拉满。
103
Replying to @dotey
Thariq's breakdown of how effort levels impact verification is incredibly useful, and we actually went deeper on this here:
Anthropic just published a guide clarifying how Claude Code's effort levels actually work. Here's what you need to know. Thariq, from Anthropic's Claude Code team, wrote up his own tests on effort in an article called "Using Claude Code: Spending your effort." His main finding: turning effort up mostly buys more verification and edge-case testing, not smarter core reasoning. Thinking helps most when failures come from missed edge cases, not from bad design or the wrong approach. Thariq said he personally uses low effort a lot when he wants to stay in the loop on a task, and reserves max effort for when he wants zero input from himself, or when hunting for security vulnerabilities. He also noted effort levels don't break Claude Code's prompt cache, addressing a common user question. The post landed right after Theo (t3.gg) went viral for saying effort dropdowns will soon disappear as models self-regulate reasoning automatically. Replies split: some builders, like Jorge and Peer Richelsen, agreed automatic effort selection is the end goal, while others treated Thariq's guide as the practical playbook for using today's manual levels well. Key numbers: - Claude Code offers 4 effort levels: low, medium, high, max - Thariq's original post: 36K views - His most-quoted reply on low vs max use cases: 22K views Anthropic's official docs separately recommend high as the minimum effort for most coding and agentic use cases, with xhigh suggested for Opus 4.7.
223