明亮而狂野,盲目而绚烂 Slow down. Have fun. Live well. INTJ-A. No ism. Lifelong Programmer and Writer. Study in Public, Building in Public. 🦀 保命

Earth
我看看 opus 5.5 是怎么个事 我秽土转生了
6
9
1,968
突然想到一件事: OpenAI 和 Anthropic 没理由做不出来这个 jev。 开源社区几个小时就搞定了。 他们没做这个判定模型唯一的解释是,不想让用户省 token 吧 。。。
可以用 Jev 动态选择 effort 吧
6
8
3,067
可以用 Jev 动态选择 effort 吧
Anthropic Claude Code 团队的 Thariq Shihipar 的这篇文章讲 Claude Code 里的 effort 设置(可以理解为投入档位)该怎么用。我想很多人都不是很清楚 Claude Code 的 effort 档位怎么选,我在看这篇文章之前也有些模糊,一般默认就是 high,现在看还是有些讲究的。 Thariq 的经验是:low 用于头脑风暴、画草图、小改动,要的是快,随时能插手;medium 用于大部分日常开发,比如实现新功能;high 用于需要验证、边界情况多的活,比如在老代码库里修 bug;max 用于让 Claude 完全自主攻克难题,比如从头到尾搭一个 App 并验证,或者给关键软件找安全漏洞。 在 Claude Code 里输入 /effort 就能切换档位,对话中途也可以换。注意只有最新的 Opus 5.5 和 Fable 5.1 不会让缓存失效,早期模型会让缓存失效。 Thariq 通过实测发现,effort 主要决定 Claude 在一个任务上花多少功夫做验证、测边界情况,以及替你拿多少主意。 effort 从 low 到 max 分几档,本质是告诉模型你愿意让它在这件事上花多少算力。同一件事,给你 1 小时,你会先交一个能用的版本,等对方反馈再改;给你 12 小时,你会自己反复打磨、检查。 最新的 Opus 5.5 和 Fable 5.1 可以在对话中途切换档位,而且不会让提示词缓存(prompt cache)失效,前面对话积累的缓存照样能用。能随时切了,很多用户就来问他到底什么时候该用哪一档。 【日常开发:需求越模糊,档位差别越大】 Thariq 让 Opus 5.5 用不同档位做同一个模糊需求:“做一个健身记录 App”。low 档只做出一个记录表和一张简单图表,档位越高功能越多,max 档还加了一张热力图。另一个任务是重新设计 Claude Code 的 /config 菜单,low 档 1 分钟交出一个能看懂思路的交互草图;max 档用了 28 分钟,样稿跟 Claude Code 真实界面很像,还附了几种操作流程的演示。 如果先让 Claude 详细采访他、整理出完整需求再动手,不同模型、不同档位的产出就很接近了。 换句话说,档位越高,Claude 替你做的假设越多。想自己掌控细节,就用低档位快速出初稿,边看边改。 他现在开发新功能的流程是:把需求交给 Claude,让它反过来问你还漏了哪些细节;用 low 档实现,检查大方向对不对,不对就继续用 low 档改;最后切到 high 档做验证和测试。 【难题:高档位用来补边界情况】 更难的任务,他去翻了 Terminal-Bench 3.0 的结果。这是一个社区出题的基准测试,题目比日常开发难得多,比如用 Verilog 写一台能装进小型 FPGA(可编程芯片)的 8 位游戏机,或者在定理证明工具 Lean 4 里完整证明一条数学定理。 他的主要结论是:边界情况越多的任务,越值得开高档位。 html-js-filter 这道题要求写一个 HTML 过滤器,把所有往网页里夹带 JavaScript 的写法都清理干净。Fable 5.1 在 low 档跑 5 次只过了 1 次,到 xhigh 档 5 次全过。low 档每次两分钟左右,写一遍过滤器,拿一个手写页面测一下就结束了。他追踪的一次 high 档运行花了约 33 分钟:先挑自己初稿的毛病,再去读解析器源码找 bug,跑了一套标准的 XSS(跨站脚本攻击)测试集,最后还写了一个随机生成网页的模糊测试程序。 Opus 5.5 修存储引擎崩溃 bug 的题也类似,low 档 0/5,xhigh 档 4/5。low 档一分钟左右就直接改代码,没先复现崩溃;xhigh 档花 11 分钟,先复现,再写随机测试,还专门确认修到一半的代码会被测试拦下来。 按领域看,硬件、代码审查、安全这类题目从高档位受益最多。但档位也有管不到的地方:加档位能减少因漏掉边界情况导致的失败,模型一开始思路就错了的话,档位开再高也救不回来。 还有一道题能看出人在不在场的区别。gsea-proteomics 要求分析一组蛋白质组学数据,判断八种处理方式里哪些效果接近目标组织。low 档的 Opus 5.5 挑了一种听起来合理的数据预处理方法,跑一遍就报结果,5 次全错;high 档试了两种预处理方法,发现得出的结论不一样,先查清原因再选定方法,5 次对了 4 次。Thariq 说,如果有人在场,Claude 可能会先问一句这个问题该怎么设定;没人在场,高档位的效果更好。 所以档位怎么选,很大程度上看你打算在这个任务里参与多少。一直默认开 high,等于每次都让 Claude 替你多拿主意,也每次都多花时间和 Token。
5
3,744
😂👍
I ported the Omarchy screensaver engine (ttfx) from Rust to x86-64 assembler, and it's up to 17x faster!! One-shot translation by Opus 5.5. We keep drilling until the agentic drill bit hits bedrock! github.com/omacom/ttfx/pull/…
1
3
654
秽土转生 cc 前第一步
5
2,309
估计没戏了,傲慢的 Anthropic 都不想理你
再尝试最后一把,找回账号
1
2
1,171
马斯克分享了他的视频,近 500万播放
My first X payout. Thank you for sharing Age of Beyond @elonmusk I can’t believe this!
1
581
这么高😂
My first X payout. Thank you for sharing Age of Beyond @elonmusk I can’t believe this!
478
今年 RustChinaConf 2026, Rust 语言类型团队 Leader 和 Rust 基金会项目董事 Jacky 会在 10.16 上午 Keynote 分享 Symposium
JUST IN: Your AI Agent is Writing Rust… But Is It Good? Explore On This Upcoming Livestream. > Symposium helps AI coding agents write better Rust by automatically providing library-specific tools, guidance, and ecosystem knowledge alongside dependencies.
5
985
Anthropic 你真的不能如此对待你的真实用户 @trq212
再尝试最后一把,找回账号
1
12
5,183
再尝试最后一把,找回账号
1
16
8,059
最近都没怎么发帖,竟然也收到了第一笔原创奖励,感谢马斯克。
2
5
636
👍
1/ Today we're announcing the stable Cua Driver release for Omarchy - a new foundation for computer use, built into the OS from the ground up. Over the last month, we worked directly with @dhh, @SpencerGBull and @vaxryy to bring a native synthetic cursor to Omarchy's Hyprland compositor, enabling true multi-cursor computer use at the OS level. Cua Driver is open source and available at github.com/trycua/cua
2
3
674
此时,我感觉很失败。 我想坐在浅色的床单边哭泣。
麻痹的 claude,为啥做的这么好 🤧
1
4
2,565
我还算好。 Anthropic 之前送来了我 600 刀,我花完了。 封号没退的钱,算是扯平了吧 🤧
Claude 封号后续,A\社回信,驳回上诉,维持原判。裁决是终局性的。充值的250刀,不予退还。
4
2
2,018
麻痹的 claude,为啥做的这么好 🤧
holy shit i asked claude to make a video on western civiization
2
8
4,721
我也想操 Opus 🤨 妈的,下周再搞个号
迭代了一下 Skill,让 Opus 5.5 基于 Zed 的代码库做了一个宣传视频。 我操,这个也很屌啊! 一直在整个编辑器里运动,通过不同的编辑器运动介绍产品的各种功能,而且卡点卡得非常好,音乐和节奏也非常好,完美地展示了这个产品的风格和它的能力。 Opus 5.5 太牛逼了!
3
8
2,514
笑死,现在大模型写的代码也是喜欢if else 防御式编程
真不算什么爆论, 吴军最近在和刘润的对谈中说,很多人写的代码根本就是不合格的程序员, 老板们宁愿找bot 去写,也不愿意找这些人去coding , 他们被称为 「if...else」工程师。
892