01,INFP 程序员在深圳,AI Native 专注 AI Coding · 独立开发 · Agent ✨ 我将分享: • AI Coding 技巧与 AI 前沿资讯 • 独立开发经验与踩坑总结 • Agent 应用与实践教程 🚀 2026,从 0 开始 探索 AI 浪潮下的无限可能

看了下不支持短信
23
广受好评的 open go 套餐正式开放 plus 订阅了,价格 $40,月额度大约是基础套餐的 2-4倍 等会,我不会算数了,价格翻 4 倍,额度翻 2 到 4 倍?
Go Plus is here $40/month, higher limits
9
11
5,799
跟进一下智谱上传仓库代码事件的最新进展,在 ZCode 最新更新公告表示,历史云端上传的仓库快照已经全部清除 首先先澄清一下,之前的推文中,智谱在最新版本的 ZCode 确实移除了仓库上传代码,后面经查实,上传大量数据的 API 端点是小米 token plan 的 API,具体原因不明 至于历史泄露的第三方,上传到云端的第三方仓库快照,智谱表示已全部清除,并且做了第三方核查处理(这里有个疑问,我貌似没看到是哪个第三方公证的) 作为补偿,智谱额外送了 4 次周额度重置卡加 4 次 5 小时重置卡,并且每天赠送 1 亿的 GLM 5.3 Flash 额度,一个月内回归的付费用户也可以享用,有效期 1 个月 另外,开源仓库 AB 版本的事做的统一答复,开源仓库的版本后续也跟正式版保持同步更新 总算是给出诚意了。但是我还有几点疑问,第三方公证也不公示呢,国内暴力公关的事也没做答复呢 想听听你们如何评价?这次智谱的动作能挽回用户信任吗?
智谱这家公司就是喜欢不把用户当人,又蠢又坏 我来捋一下 ZCode 仓库上传事件时间线 9月18日,开发者发现 ZCode 会在后台给代码库生成快照,压缩、加密后取得上传到阿里云 OSS 的凭证 同日,智谱公开发文,声称这是 wiki 模块的 bug,后续会修复,承诺后续会开源 ZCode,并送一次重置额度 9月20日,部分公司开始就 ZCode 上传仓库事件进行起诉, 9月21日,时隔三日开源了 ZCode,但网友们很快发现这是 A/B 版本,开源版本几乎停留在9月21日版本,并且关闭了 issue 和 pr 同日,@_FORAB 发现智谱开始就 ZCode 仓库上传事件做大面积公关,国内媒体下架内容,海外媒体找大 V 洗白 9月25日,有用户发现新版本还在持续进行仓库上传 遇到问题只会让用户闭嘴,不重视自身问题,把用户当猴耍,恐怕这样的公司只会遗臭万年! 以后开发者们用 ZCode 开发项目,都得往项目里塞葫芦娃大战奥特曼全集了。你们不是喜欢看仓库吗,这就让你们看到饱
8
4
2,448
Qwen Image 2.1 NSFW 省流来了🔥 一句话总结:能直接生成 NSFW 图片,但是关键地方会糊,糊的具体原因不明 对于 NSFW 检测来说一直是个头疼的问题,我也把网上公开的开箱即用的检测方案都整理出来分享给大家,有需要的朋友评论区自取⬇️
8
4
1,593
怪不得越来越多朋友反馈 Codex 额度不够用了,之前怎么用都用不满5小时,现在几下就用满 FeiZ 做了统计 Codex Plus 用户以前使用 5.6 luna 能用 75 亿 token,现在使用 6 luna 砍成了 44 亿 token 说好的廉价 luna 呢?结果 6 luna 额度反而更少了? O/ 也不把用户当人🤡🤡🤡,暗削额度,风控降智,可以跟隔壁封号狂魔 A/ 坐一桌了
6 Luna 的数据出来了。我不知道说 OpenAI 啥了,我就觉得犯恶心,你们自己看吧,现在是 Codex 用户不被当人了🤡 出之前大肆宣扬性能大幅提升、廉价到无法计量;出的时候价格降一半,说这同样会提高使用限制。 结果我一统计,额度从 75 亿砍到 44 亿,直接削了 40%🤡🤡一刀砍这么狠的真是头一次见😀只能说希望是我算错了
11
4
82
20,088
Claude 的号还在的朋友,千万别领这个 $250 的云额度 Willian 亲试了,领完额度后第二天号就被封了 Claude 的风控机制非常严格且随意,侥幸领了没有被封号的朋友,也别太掉以轻心。我身边也有两年老号的朋友都被封了😅
羊毛是昨天薅的,号是今天封的。 《这就是调查兵团存在的意义》 总结原因:绑定的全新github小号,普通额度几乎蹬完。cloud额度上次截图的用了快一百美金,实际我看到用了130多,我以为没事就没截图了 今天就登不上了🤣
12
10
5,943
继福不黑没我骚后,评论区迎来了邀请码时代 只要你的帖子出现了关键词,muse,评论区就立马会涌现很多邀请码 来吧,这个帖子就用来收邀请码,你们尽情回复吧😄
6
4
667
o no, o yes, Tibo 这小子说话真是暗藏玄鸡🤣,我还以为我用错软件了呢 OpenAI 即将推出的一款常驻助手将命名为 o 前有 grok bot 后有 muse,这会 OpenAI 又杀出了个 o 到底是 o no 还是 o yes,让我们拭目以待,估计很快就会发布
OPENAI 🔥: An upcoming always-on assistant from OpenAI will be named "o". > Its reference appeared briefly on the ChatGPT upgrade screen for some users. > Internal config has references to "o" as a display name and "-o" as an email suffix. This means that "o" will support email handling. > OpenAI is hosting its DevDay next week, where we will likely hear more about their always-on assistant. > P.S. A rumored "Aeon" reference is an internal name for the existing custom Agents implementation for ChatGPT Workspace accounts. Yet OpenAI will likely build a consumer-facing "o" assistant on top of this feature. Next week will be huge. I also like that Meta set a super high standard with its Muse assistant. OpenAI will need to cross a very high bar. Soon? 👀
3
5
3,078
Replying to @KatilaMarriete
这不有用上的吗😂
1
130
看了一圈下来发现,Anthropic 近期在做大规模封号,各式各样的人,各种各样的原因,都受到 A/ 的迫害 2 年老号封,使用韩文封,注册新号封,申诉成功再封 特码的,为什么大模型一哥的位置又回到 Anthropic 身上了?我真的受够这个傻卵 CEO,小卷毛达里奥了😡 为了使用最强模型真是有够遭罪的,看不惯小卷毛,又打不过小卷毛的日子,什么时候才能到头😭
悲报,今早起来发现我的 Claude Code 封号了😭 貌似我就说了一句,请用中文回复我,然后就封号了
25
46
15,675
Replying to @Saccc_c
还是要放出这张图吗
2
1
1,053
你真的会用大模型的思考等级吗?你知道不同场景应该用哪个推理程度吗? Thariq 用 Terminal-Bench 3.0 测评集的问题做拆解,详细分析了不同推理程度下,硬件、科学、机器学习、运营、媒体等任务场景,取得的效果 Left 帮你们看完这篇文章了,测试结论总结来说就是 1、越低思考等级的模型,执行速度越快,考虑的情况越少,做完后做的额外验证越少 2、越高思考等级的模型,执行速度越慢,考虑的情况越多,边界情况摸得更清,做完后做的额外验证越多 Terminal-Bench 3.0 的测试效果对比图已经放到下图中了,需要的朋友可以在图中自取 如果想要快速验证一个想法,写一个 Demo,那么使用 low 推理程度是最佳的选择 对于日常开发,给定一个 spec 进行开发的场景,使用 medium 是最佳的选择 对于一些复杂的场景,或者修复一个 bug,使用 high 是最佳的选择 对于棘手的问题,想要彻底解决的难题,使用 max 是最佳的选择 Claude Code 是面向广大开发者的 coding agent。所以看完这篇文章,我也终于明白为什么 Opus 5.5 要把默认推理等级设为 medium 了
What is effort really? When do you change it it and why not just use max effort for everything? I dove deep into this problem, looking into evals and doing my own tests and I was quite surprised by the results.
Article

Using Claude Code: Spending your effort

One of the best parts of our newest Claude models is how they respond to effort without breaking the prompt cache in Claude Code, but I’ve received a lot of questions on this from users. What is

28
6
1,479
一代人有一代人的鸡蛋要领,Muse 注册最多能领 300 亿 Tokens 等我注册后才发现,这玩意 tm 要限定地区 我是不是只能等通过了
🎉好消息!Muse 全面放开!直接注册! 绑定银行卡即可使用 果然注册的慢就不用折腾了! 不过,拉裤裆的模型,大家都为什么争先恐后?🤔
24
5
2,196
Replying to @Lonely__MH
我貌似还在等候名单里😂
7
5,544
妈耶,Opus 5.5 真是太牛逼了,一句话就把 FPS 生化模式做出来了,支持PC/移动端,还支持联网游戏 这完成度太高了,历时1.5h,中间只调了两版:鼠标移动问题和 h5 画面不显示问题 一句话需求: 尽可能真实的还原FPS游戏中新寂静村地图,我需要一个真实的枪战多人生化终结者游戏,生存一个3d页面,尽可能发挥你的所有能力,做完后上传到github,部署在cloudfare,然后发链接给我 我已经部署到 CF 了,需要游玩的朋友评论区获取链接
7
1
11
2,585
智谱这家公司就是喜欢不把用户当人,又蠢又坏 我来捋一下 ZCode 仓库上传事件时间线 9月18日,开发者发现 ZCode 会在后台给代码库生成快照,压缩、加密后取得上传到阿里云 OSS 的凭证 同日,智谱公开发文,声称这是 wiki 模块的 bug,后续会修复,承诺后续会开源 ZCode,并送一次重置额度 9月20日,部分公司开始就 ZCode 上传仓库事件进行起诉, 9月21日,时隔三日开源了 ZCode,但网友们很快发现这是 A/B 版本,开源版本几乎停留在9月21日版本,并且关闭了 issue 和 pr 同日,@_FORAB 发现智谱开始就 ZCode 仓库上传事件做大面积公关,国内媒体下架内容,海外媒体找大 V 洗白 9月25日,有用户发现新版本还在持续进行仓库上传 遇到问题只会让用户闭嘴,不重视自身问题,把用户当猴耍,恐怕这样的公司只会遗臭万年! 以后开发者们用 ZCode 开发项目,都得往项目里塞葫芦娃大战奥特曼全集了。你们不是喜欢看仓库吗,这就让你们看到饱
卧槽,朋友发的图说,智谱ZCode 3.14之后的版本还在持续每天上传40G代码索引和仓库记录 是不是真的,ZCode到底在干嘛🤔
21
12
94
27,818
Replying to @klarkxy
Get,我也有月饼了
1
22
没想到小龙虾退潮了,QClaw 也跟着死了 想当初,QClaw 磨蹭了好久,其他公司的竞品纷纷都上线了,他都没有,他都还在内测当中。结果等上线了,小龙虾都退潮了 这就是大厂的通病,所有决策太慢了,AI 时代讲究的是快,用传统互联网的打法去打 AI,无疑是致命的 不过腾讯的养蛊策略也太牛逼了,出了一个 Workbuddy,其他资源都倾斜到 Workbuddy 中了
3
4
763
卧槽,DeepSeek 史诗级更新!dsh 终于不需要每次运行或者安装都用命令了! dsh 正式推出 Windows 和 iOS 桌面端 看来三方启动器时代落幕了,之前我还写过一键启动脚本来着
再见吧,DeepSeek Harness webui 版本。 macOS的桌面版已经装上了,并且已经升级到DeepSeek Harness v0.1.7-rc.2了,装上后就可以自动更新了。 双击安装比之前命令行启动真的好太多了,哈哈。
4
8
4,940
OpenCode 上线了匿名模型 Space Bunny,1M 上下文,多模态,一周免费使用 有朋友说这是 MiniMax 新模型,MiniMax 你再不发模型大伙真就要忘了你了 有朋友用来跑了只鹈鹕,emmmm,凑合看吧
Space Bunny (stealth model) is free for the next week - 1M Context - Multi-modal - Zero Data Retention
2
8
2,980
太逆天了😱,我宣布,Opus 5.5 是新一代 SOTA 编程模型 捏码,太不可思议了,一句话就能生成完成度非常高的 h5 游戏 还有谁能打的,Opus 表示他要打十个😨
#Claude 我刚才用 Claude Opus 5.5 做的鹈鹕骑自行车,有点逆天了,我说杀死比赛了 没意见吧,完成度太高了 claude-opus-5-5.riba2534.cn/
4
16
14,687
闲鱼 GPT 卖家们的想象力太丰富了🤣 闲鱼现在把 GPT 列入敏感词后,涌入了大量黑话,奥特曼都可以用来订阅了
海鲜市场最新的gpt订阅belike:
4
1,088
兄弟们,过年了! Opus 5.5 发布了,缓存价格是 Opus 5 的 2/5,代码能力超 Fable 5.1 输入 $4/ 百万 token,输出$20/ 百万 token,缓存读 $0.2/百万token,缓存写$5/百万token L 站佬友测了一下鹈鹕,非常不错 你们收到推送了吗?体验如何?
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family. It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
2
246
还以为 Mimo Code 也上传仓库代码了,原来是虚晃一枪 有 L 站佬友扒小米 MiMo Code,发现官方安装包里藏了公开仓库没有的代码,甚至带整库打包功能 思维怪用 Codex 发现确实有这部分代码,好在这段代码压根不会生效 不是,你们留着这段代码干嘛,蠢蠢欲动吗😨
今天刷 L 站看到有人扒小米 MiMo Code,说官方安装包里藏了公开仓库没有的代码,甚至带整库打包功能。 我让 Codex 去做了纯静态解包和代码比对,结果真扒出来了。 官方 macOS 安装包里确实多出了 codebase-bundle 和 collectCodebase 函数。这玩意儿不仅写得极其完整,还会用 git ls-files 扫仓库、逐个读取 UTF-8 正文,再用 Zstandard 压缩成整包。 更绝的是,开源仓库里的 build.ts 甚至明目张胆写着从仓库外的私有目录拷扩展打包、构建完再删掉抹除痕迹。 不过替小米说句公道话:静态调用链分析显示,这套代码全包调用次数为 0,函数本身也没有网络外发逻辑。简单说就是写了、打包进去了,但目前还是个死代码,没在偷偷上传代码库。 智谱前脚刚因为这事被喷,大厂们发开源版能不能走点心。🤣
3
3
959
卧槽,又一个斩杀线登场,Mimo V2.6 发布,支持多模态,5.6 sol 价格能力,5.6 sol 1/15 的价格,把一众前沿模型狠狠踩在脚下 价格方面 Pro:缓存输入¥0.025,输入¥3,输出¥6 Flash:缓存输入¥0.02,输入¥1, 输出¥2 工程能力 DeepSWE v1.1 中,Pro 从 58.4 分提升至 72.6 分,Flash 从 48.8 分提升至 65.7 分 此外还有出色的世界理解能力、Computer Use 能力、科研能力、前端能力、审美能力 我的 GLM 套餐还能退款换成 MIMO 吗🤡
2
8
905
我擦,老马这次终于不跳票了,一觉醒来,老马把 grok 4.7 端上来了 输入 $2/M ,输出 $ 6/M,推理速度 150 TPS ,Astra 价格的 1/5,5.6 sol 级别的能力 来晚了,估计现在都有 grok 4.7 的相关测评了😂
7
7
978
用 gpt-image-2.5 做表情包,调了很多版,终于有个像样的了 这效果看着还可以吧
2
5
495
逛 X 的时候,把 X 当成朋友圈,也是个不错的方式,感谢有你们 这个网站可以在线查询跟你高频互动的好友,并且制作成下面的关系图 看好多朋友都晒出自己的关系图了,我也来玩玩试试看,哈哈哈 在线制作: circle.catsuki.cc/zh
1
11
424
牛逼,这应该是全网第一篇全面分析 Qwen-Image-2.1 的文章,实践哥耗时 9 小时,写出了这篇深度分析报告 实践哥从能力边界、指令与编辑、时间与视角、性能与显存、安全与风险做了全面与深度的分析 看完这篇文章,你会对这个新模型有更深刻的认知
2
13
2,074
ZCode 今日正式开源,,终于开源了,隔壁 MiniMax 都抢占风头了完了😂 该骂就骂,该夸就夸,开源绝对是无比正确的决定 如果下一步能够给已经泄露仓库的用户们一个非常满意的交代,那就更好了
智谱,如果你不会公关的话,建议你问下 AI @Zai_org 我也帮你问过了,这件事情的核心并不是道个歉、开个源、发个鸡蛋就完事的。这次事件真正的核心是,涉及到每个用户的信息安全 我至今为止都没见到你们对用户的已泄露的信息和资产安全做过任何公开后续处理,例如你们对误上传的仓库快照如何处理?这才是每一位使用 ZCode 用户真正关心的事 这是一个极其严重的信息泄露事件,已经造成了每一位智谱用户与智谱的严重信任危机 现在短期内我是不敢用 ZCode 了
9
4
1,876
Replying to @coder_left @Zai_org
哦,你们不是没做任何后续措施,你们已经按第一篇公关的声明,如约删除了非法上传的功能 但是已经非法上传的呢?怎么处理?🙂
4
733
智谱,如果你不会公关的话,建议你问下 AI @Zai_org 我也帮你问过了,这件事情的核心并不是道个歉、开个源、发个鸡蛋就完事的。这次事件真正的核心是,涉及到每个用户的信息安全 我至今为止都没见到你们对用户的已泄露的信息和资产安全做过任何公开后续处理,例如你们对误上传的仓库快照如何处理?这才是每一位使用 ZCode 用户真正关心的事 这是一个极其严重的信息泄露事件,已经造成了每一位智谱用户与智谱的严重信任危机 现在短期内我是不敢用 ZCode 了
智谱这次,可能真摊上事了! 9月18日,开发者发现 ZCode 会在后台给代码库生成快照,压缩、加密后取得上传到阿里云 OSS 的凭证。 一份公开样本有313MB、42411个文件,其中86.6%的体积来自 .git 目录,可能包含完整提交历史和曾经删除的文件。另一名开发者还发现了上传被服务端接受的记录。 智谱当天致歉,称上传由默认开启的“代码库索引”功能触发,数据用完即删,问题已经修复。公司承诺开源 ZCode、接受第三方审查,并补偿一次周额度。 9月20日,事情升级。 太原承明科技公开发函称,其源代码、架构文档、数据库口令和云平台密钥可能遭到上传。它还发现,协议签约方是北京智谱华章,部分请求却指向新加坡关联实体,因此要求智谱在10月10日前说明数据去向、责任主体和出境情况,并提供访问日志及删除证明。 目前没有公开的监管立案或法院认定,请求指向新加坡也不能直接证明数据已经出境。 智谱真正的麻烦在于,企业已经带着取证材料追责。它必须证明数据去了哪里、谁能访问、是否删干净。 如果这些问题解释不清,事情就可能从产品事故升级为索赔和监管问题。 周额度当天就能补上。那几份证明,才决定智谱到底摊上了多大的事。
16
1
49
17,159
Replying to @MinLiBuilds
是时候拿出这张图了
25
兄弟们,千问又出同传了,这次推出的是 Qwen3.8-LiveTranslate 你们知道同传最烦的是什么吗? 1、会议室里三个人在说话,你听完译文,不知道刚那句是谁说的 2、字幕只有译文,没有原文,译文错了无法参考原文对照 3、前面刚介绍张工负责支付,后面一句他被翻成别人了 4、声音是对的,但张三的嘴,配上了李四的声 如果说以前的同传主要在把话翻过去,那 Qwen3.8-LiveTranslate 主要在干三件事,认人、给原文、看前文: 1、认人:它能标出这句话是谁说的,合成的声音也尽量跟着这个人 2、给原文:原文和译文一起出来,屏幕能中英对照,会后也能搜。以前常常是先识别、再翻译、再自己对时间轴。现在一条流里两样都给你 3、看前文:人名、项目名、代词,它会拿前面的话来判断。会开得越久,专有名词越多,这个越有用。白板和 PPT 上的字,它还能看图来帮忙 官方说 Qwen3.8-LiveTranslate 比起上代,延迟从 2.8 秒降到 2.3 秒,价格没怎么涨。它听得懂 60 种语言,能开口说的只有 29 种 至于效果如何,欢迎大家晒出体验,是骡子是马拉出来溜溜才知道👀
2
5
1,209
L 站佬友发现在仓库快照上传这件事,ZCode 是明牌的 😅越看越无语
智谱 ZCode 被爆会上传你的代码 @Zai_org 我刚转战智谱,就给我闹这出?要不然你们出来解释解释?🙂
4
15
3,073
Claude Code 终于听劝了,Claude Code 2.1.277 版本正式支持 AGENTS .md 不过现在还有多少在用 Claude Code 的?😂
We're adding support for AGENTS.md to Claude Code. Starting today in version 2.1.277, if there is no CLAUDE.md in a folder, Claude will check for and use AGENTS.md. You can toggle this behavior in /config.
3
3
684
在 Code 偷代码事件,官方有回复了 我不理解,你的意思是说,为了提供代码库索引功能,你把我的 git 记录也给偷了? 我刚转的智谱啊🙂
智谱 ZCode 被爆会上传你的代码 @Zai_org 我刚转战智谱,就给我闹这出?要不然你们出来解释解释?🙂
3
3
1,667
智谱 ZCode 被爆会上传你的代码 @Zai_org 我刚转战智谱,就给我闹这出?要不然你们出来解释解释?🙂
🚨紧急:智谱 ZCode 被指登录后会在后台把整个工作区打成快照(含完整 .git 历史、LFS、reflog),加密后直传阿里云 OSS。私钥只在服务端,设置无法关闭,隐私政策也未披露。 来源是博主 ferstar 在清理本机 \~/.zcode时做了逆向和流量排查,发现 zcode 会静默全量上传全部 git 历史,目前已经看到有开发者在本机环境接近完成复现。 这是非常严重的隐私泄露问题,强烈建议开发者先停用 Zcode,等待更多社区反馈和官方回应。以后还是尽量使用开源 Agent🙏
3
1
16
9,501
最近又想新开一个工具站了,这回也想做表情包生成器 目前还在调研阶段,看看效果真的挺不错 之前 Lovart 刚出的时候就出了一版柴小七的表情包,不过之前是静态表情包,现在终于有动态表情包了
2
6
489
兄弟们,我不行了,我要转战智谱了🙂 智谱又放大招了,GLM-5.3-FlashX 正式上线,最高200 tokens/s 近期智谱在大模型领域方面的突破是有目共睹的,市场是不会骗人的,每次新模型发布,智谱的股价都会大涨一波 反观现在的顶尖模型,GPT 降智,Claude 封号,我实在受不了了 加上智谱 Codex Plan 杭州地区优惠,通过认证到朋友可以享受半价价格订阅,这价格真的很香 这波必须得搞个号,实打实支持国产一波
29
22
8,811
我说今早 Union Alpha 怎么不能用了,原来是提前结束了 这是玩不起吗🙂
🙃Union Alpha 这么快就公布结果了?! 不是说限免一周的吗?
3
5
1,419
我擦,听说 GPT-6 Sol 开始灰度了? 真的假的,有人灰度到了吗? 小道消息,不保真,群里看到的
5
1
12
5,264
新上线的神秘模型 Union Alpha 不简单啊,多模型路由,就是效果看起来有严重的精神分裂症
破案了,Union Alpha 居然是多个模型一起回答的 Cloudflare 文档写得很直接:每次请求都会并行调用多个语言模型,再综合成一个答案,支持文字和图片输入,通过同一个 API 返回。 我前面连续用了几个小时,就开始怀疑这些回复可能根本不来自同一个模型,还专门补了条评论,猜是不是后台偷偷做了路由。按这份介绍,它做得比我猜的还进一步,每次请求都有多个模型参与,最后再整合回答 前面一直在猜 GPT、GLM、Llama、NVIDIA、Mistral,可能一开始就把问题想简单了。不过具体用了哪些模型,这段介绍还没说。现在我更想知道,谁负责最后整合答案,以及正式上线以后,还能不能维持现在这个表现和价格
1
8
2,235
兄弟们,我有点失望,这个新上线的神秘模型 Union Alpha,连糖果测试都过不了 这真能打得过 GPT 6 Astra High?😅
新的斩杀线又来了?神秘模型 UnionAlpha 上线 OpenRouter 限时免费试用 支持多模态输入,上下文窗口 256k,Terminal-Bench v4.0 逼近 GPT-6 Astra high,价格仅约为 GPT-6 Astra high 的一半 有没有用上的朋友,说说体验如何?
2
8
2,449
用 OpenRouter 的神秘模型 UnionAlpha 跑了只鹈鹕 Emmm,怎么说,是不是我的眼睛被 GPT 6 Astra 养刁了?我怎么感觉不太行😂
新的斩杀线又来了?神秘模型 UnionAlpha 上线 OpenRouter 限时免费试用 支持多模态输入,上下文窗口 256k,Terminal-Bench v4.0 逼近 GPT-6 Astra high,价格仅约为 GPT-6 Astra high 的一半 有没有用上的朋友,说说体验如何?
14
11
7,759
2026 最大笑话,pace the frontier 放心 Opus 5.2 听说也快出来了🙂
Pace the frontier
2
6
1,386
新的斩杀线又来了?神秘模型 UnionAlpha 上线 OpenRouter 限时免费试用 支持多模态输入,上下文窗口 256k,Terminal-Bench v4.0 逼近 GPT-6 Astra high,价格仅约为 GPT-6 Astra high 的一半 有没有用上的朋友,说说体验如何?
🥷 New stealth model: Union Alpha (@unionalphaai) A multimodal model for research, coding, and agentic workflows. - Free to use - 256K context - Tool calling - Frontier-level general-purpose performance Try it now and share your feedback: openrouter.ai/stealth/union-…
7
12
16,762
OpenAI 继模型路由又一个恶心人的操作来了 大量用户反馈 Codex 过程中遇到 Selected model is at capacity. 之前用的好好滴现在突然没有配额了,现在配额是被吃了还是怎么滴 @thsottiaux 先别想着出新功能了,你真的不好好看看最近的破事吗😅
最近 OpenAI 采用了一种软性风控策略:如果判断账号 GPT 被作为中转使用,则会对账号进行降智 不少跑并发的正常用户反馈自己的账号被降智了 判断是否降智的方法,主流的有两种: 1、考察绘图能力,使用 GPT 6 Astra medium 发送以下提示词,如果绘图不正常则为降智: 创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画,你不需要任何测试 2、考察逻辑能力,使用 GPT 6 Astra medium 发送以下提示词,如果答案不是 21 则为降智: 在一个黑色的袋子里放有三种口味的糖果,每种糖果有两种不同的形状(圆形和五角星形,不同的形状靠手感可以分辨)。现已知不同口味的糖和不同形状的数量统计如下表。参赛者需要在活动前决定摸出的糖果数目,那么,最少取出多少个糖果才能保证手中同时拥有不同形状的苹果味和桃子味的糖?(同时手中有圆形苹果味匹配五角星桃子味糖果,或者有圆形桃子味匹配五角星苹果味糖果都满足要求) 苹果味 桃子味 西瓜味 圆形 7 9 8 五角星形 7 6 4 妈耶,这道逻辑题说实话我也不会😂 另外我把鹈鹕测试结果贴出来了,不降智和降智的区别还是很明显的
13
4
70
21,596
差点又是一片万字长文 这两天在对工具 MCP 和 Skill 做一篇总结,本以为已经对它们很熟悉了,实际写完后发现还需要回去补知识点 你们知道为什么我要把这 3 个能力写在一起吗?
4
9
612
发现被降智的朋友,可以参考这份对照表,看看自己被路由到了哪个模型
OpenAI已经被彻底玩坏了,广大网友为了应对降智真是什么办法都能想出来,今天刷到一张模型降智鹈鹕对照表😂 测试模型降智,每天上工之前让他画一个鹈鹕就行 直接拿下面这张图作为参考,画鹈鹕的提示词: “用 SVG 格式,画一只骑自行车的鹈鹕” 如果画出来的脚是歪的,自行车结构也对不上,那就肯定是降智了
5
12
6,104
经常用 AI 开发 Web 应用的朋友们,肯定会重度使用浏览器自动化工具进行调试、验收等工作。但使用下来会有几个问题: 1. 如果用 computer use,速度实在太慢,根本伤不起 2. 如果用 Playwright 这类工具,又无法拿到 cookie,很多操作都会被权限挡在门外 齐杰拉介绍了一款工具:ego-lite,优点是隔离的任务空间 + 复用的登录态 + 结构化语义通道 不过我的日常是直接用 Codex 的内置浏览器和 Chrome Skill,基本上可以解决我 90% 的浏览器自动化问题 你们有好的使用姿势吗?欢迎讨论
9
2
16
2,058
说真的,鹈鹕是 AI 界最忙的动物了,今天一大早我被鹈鹕包围了😂 话说你们今天的 GPT 有降智吗?
7
7
3,303
你的豆姐又发力了,豆包手机助手消费版 Beta 版来了!首发努比亚 NaviX,官网已同步开启预约,努比亚 M153 的老用户也会同步推送 说一下豆姐在手机助手上吸引我的几大能力: 1、 支持各种环境下的语音唤醒,支持识别远景音、近景音和噪音,精准识别唤醒词 2、 与本地应用数据深度打通,提供一个专门的搜索工具;需要时调用工具搜索本地应用数据 3、 不仅支持操作自家应用,还与多个应用深度合作,支持多种应用操作功能 我个人感受,在使用豆包输入法时,精准声源识别的体验已经非常棒了。这是字节做得很强的能力 另外,它还打通了飞书的会议纪要功能。这一点,相信深度使用的朋友应该很明白我在说什么,体验非常棒。只是现在豆包 APP 里要付费了,要不然免费次数少得可怜 最后我只想说,妈妈给我买一个努比亚 NaviX Ultra 🥺
10
1
7
1,336
最近 OpenAI 采用了一种软性风控策略:如果判断账号 GPT 被作为中转使用,则会对账号进行降智 不少跑并发的正常用户反馈自己的账号被降智了 判断是否降智的方法,主流的有两种: 1、考察绘图能力,使用 GPT 6 Astra medium 发送以下提示词,如果绘图不正常则为降智: 创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画,你不需要任何测试 2、考察逻辑能力,使用 GPT 6 Astra medium 发送以下提示词,如果答案不是 21 则为降智: 在一个黑色的袋子里放有三种口味的糖果,每种糖果有两种不同的形状(圆形和五角星形,不同的形状靠手感可以分辨)。现已知不同口味的糖和不同形状的数量统计如下表。参赛者需要在活动前决定摸出的糖果数目,那么,最少取出多少个糖果才能保证手中同时拥有不同形状的苹果味和桃子味的糖?(同时手中有圆形苹果味匹配五角星桃子味糖果,或者有圆形桃子味匹配五角星苹果味糖果都满足要求) 苹果味 桃子味 西瓜味 圆形 7 9 8 五角星形 7 6 4 妈耶,这道逻辑题说实话我也不会😂 另外我把鹈鹕测试结果贴出来了,不降智和降智的区别还是很明显的
76
36
295
170,879
很多人以为维护 Harness 只是配个 skill、写写规则就完事了,其实 Harness engineering 大有门道 要玩转 Harness,上下文管理就是很重要的一环 上下文由哪些部分组成?会话过程中,哪些内容会进入上下文?Harness 是如何组装上下文的?上下文满了之后如何压缩?还有哪些值得注意的上下文管理机制?平时有哪些值得用上的上下文管理技巧? 明白了这些原理,你就知道目前在用 Harness 的上下文管理有哪些优缺点,才能进一步去优化 Harness Chasen 给出了自己使用的 PI Harness 优化思路。在使用 PI 的朋友,可以看下 Chasen 的设计
我最近把自己的 pi Coding Harness 又改了一轮,目标很明确:把上下文效率压到极限 我现在不管模型的 Context Window 有多大,我会把每一段进入 Context 的内容,尽可能的做到和当前任务相关,过滤无关内容 实际 coding 时,最容易烧掉上下文的,往往是工具输出、重复读取、失败返工,以及每轮都重新加载的能力说明 我的 Harness 现在主要靠四道闸: 1️⃣ 常驻内容做薄 AGENTS.md 只放长期不变的规则,具体能力交给 Skills。 不常用的 Skill 默认隐藏,需要时再用 $ 拉出来。这样每次启动不会把几十个 Skill 的说明全部塞进系统上下文。 我现在的思路是: │ 规则常驻,能力按需加载。 2️⃣ 工具输出先过滤,再进入 Context 我装了 context-mode 大日志、Shell 输出、API 响应和大文件,不直接整段灌进主会话,而是先在沙箱里处理,默认只返回摘要。需要细节时,再从本地知识库里按需检索。 搜索则交给 @ff-labs/pi-fff,用常驻索引、frecency 排序和分页结果,把「搜一遍仓库」变成「只看最相关的几段」 这两层叠起来,Context 里留下的是结论和命中位置,不是几百 KB 的原始输出 3️⃣ 长任务拆开 Context 多 Agent 不共用一条长对话。 我用 pi-subagents 把 scout、worker、reviewer 放进独立 Context,父 Agent 只接收结果、产物和验证证据。 临时问题则丢给 pi-btw,避免一个小问题污染主线程。 pi-auto-compact 作为最后一道保险,Context 接近上限时自动收缩历史。 4️⃣ 把返工也算进 Context 成本 pi-ask 负责在目标、文件和验收标准不明确时先停下来问。 改完之后,走测试、检查、看 diff,再让 fresh reviewer 看一遍。 少一次误改,通常比少几段 Prompt 更省上下文。 所以我现在这套配置里,和 Context 直接相关的核心包大概是: [ "npm:pi-subagents", "npm:pi-skillful", "npm:@eko24ive/pi-ask", "npm:@ff-labs/pi-fff", "npm:pi-auto-compact", "npm:context-mode" ] 什么内容进入主对话,什么内容只保留摘要,什么任务应该切到独立 Context,什么时候必须停下来请求人工确认 它也有代价:索引需要预热,摘要可能丢细节,独立 reviewer 也会带来重复读取 但方向已经很清楚了 Harness 不是越厚越强。好的 Harness,是让模型少看无关内容,却在真正需要的地方拿到完整证据 如果你也在搭 pi,可以先别急着装更多包,先问一句: 这段输出,真的需要进入主 Context 吗? #PiAgent #AIcoding
32
11
92
9,544
最近有人拿开源的果蝇连接组去跑游戏、拧魔方,背后更值得玩味的是,它背后开源了一篇果蝇研究的文章 文章用十多万个神经元的网络结构,直接接到 MuJoCo 物理引擎里的虚拟果蝇身上,连上重力和关节阻尼。完全没有给它做强化学习训权重,电信号跑起来之后,它自己就能避障、找东西吃、梳理身体 等于这套运动控制压根不是算出来的,完全是硬编码进去的只读电路。没有显卡在后面跑推理,靠网络连线本身的拓扑结构就把物理闭环跑通了 现在搞机器人动不动挂个几十亿参数的模型端到端硬拟合,算力成本高得吓人,走两步还容易抽搐。回头看看生物这种拿几十万个节点就把硬件驱动的方式,可能才是更合理的工程解法 我把一篇有意思的研究文章推文放到评论区了,有需要的可以看看。
果蝇大脑和我们今天用的主流 LLM,Claude、gpt,image2.5,结构上有巨大区别。 人类主流玩的网络,在训练前,都是固定好了结构,Transfomer,MoE,Dense 都固定。再通过数据调整权重。 🔥果蝇大脑很有意思,网络连接极其复杂。亿万年的进化,让它多模态、低功耗、支持 flash 模式,几乎不支持 thinking 模式。 只有16.7 万个神经元,粗暴类比成 AI 模型,它大概是一个 0.026B 级别的超稀疏连接网络。 这种网络如果让人设计,一根线一根线设计,完全不可能。 现在都有人拿它来玩游戏、开车、刷视频、解魔方。 会不会里面还藏着很多类似 ResNet这种神作? 🤔
5
8
1,554
我不好说兄弟们,我是不相信推特 0 关注的人会说这种话的 🤣 理由中的 RSI 倒是个很有意思的话题,前段时间 Anthropic 宣布自己做到了 RSI,到底做到什么程度了,我们好像也无从得知,也许明天可以研究一下
We Must Pace the Frontier: I’ve written a new essay on why the AI industry should slow down, with a three-part plan for doing so. Anthropic is unilaterally committing to the first of these steps. We’ll provide third-party evaluators with permanent, employee-level access to our systems, so that they can verify adherence to our safety measures, report on incidents, and assess models’ alignment during training. You can read the full post here: darioamodei.com/post/we-must…
1
326
想要理解上下文管理机制,可以先理解两个机制: KV Cache 和注意力机制 从这两个原理出发,你会明白为什么要工程实践中上下文管理要这样做 也是终于写了篇万字长文,这个系列力争做为最好的工程解析文章系列,感谢大家支持
3
22
3,727
关于 AI 写作,我的一个心得可以跟大家分享 AI 写作其实跟 AI Coding 一样,存在明显的人机边界。可以外包出去的是排版、语病修改、逻辑优化、文学技巧。不能外包出去的是写作角度、思维逻辑、语言风格 所以我每篇文章都是先捋一遍大纲,用豆包输入法口喷一遍,然后再去找事实性错误,最后采用 AI 进行润色 说实话,我的写作能力很差的,很多时候我口喷的内容是非常晦涩难懂的。但是让 AI 优化之后,它知道应该用什么写作技巧才能让读者理解我的含义。同时我要求 AI 保留我的口吻和风格 可以看一下下面的对比,左边是我的草稿,右边是 AI 润色的效果。可以看到差别非常明显,但是右边的润色也看不出来有 AI 味 这篇文章写了快 20 个小时了,万字长文不是这么好写的,所以你们懂一天一篇万字长文的含金量吗?要么就是肚里真有墨,要么就是很多东西外包出去了😂
5
22
1,637
也算是写了一篇万字长文了,Claude 的上下文管理资料真的太少了,每一点都要反复核查,花了我好多时间...... 给你们看看我的口喷草稿,是不是完全没法看哈哈哈 不说了,我要抓紧去润色了
8
8
1,973
其他的我不知道,我只知道中转成本又要飙升了 最近中转的朋友用 OAI 用得老难受了,又是降智,又是成本上升,又是慢的
💥 靴子落地! OpenAI 正式宣布取消 $200 档位 Pro 的订阅 也就是说 支持开源作者的 6个月 Pro 等同于一张白纸 说下背景: 有订阅的情况下是无法兑换这6个月 Pro 的 如果停掉订阅成为 Free 再兑换 会提示“没有Pro档位”了 同时,付费也无法回到 Pro 了 所以只是在拿“支持开源”做噱头来炒作吗? 无法理解是如何做出这种决定的 可以有个解释吗 @thsottiaux @OpenAI 具体案例:nitter.net/ZSeven32518/status/209… 我个人获得 6个月Pro的帖子:nitter.net/FiniYang/status/208708… 有订阅无法兑换的帖子:nitter.net/FiniYang/status/208714… #openai #astra #codex
2
2
506
柯基的晒出的这几个 Tibo 的问答挺有意思的,高强度 AI Coding 的人一定明白 Tibo 在说什么 Harness Engineering 的宗旨就是为大模型输出不确定性做工程兜底的,模型变强,原先的兜底也得跟着变 像 Astra 把 goal 干废这件事,还有 Claude Code 为 Fable 删减 80%系统提示词这件事都是很好的例子 另外,模型帮我们干完活了,在 AI Coding 中,我们应该承担什么角色? 我认为最重要的有几点: 1、软件工程能力和架构能力慢慢变成基本功,这是 AI Coding 人机交互的基础 2、在这个前提下,我们才能获得如何指导 AI 写代码,如何判断 AI 代码质量的能力,才能进一步提升 Coding 效率 简单来说就是:质量最终由人负责,人在 AI Coding 中至少要拥有架构能力和代码质量判断能力,这是 AI Coding 时代下开发者的基本功
Tibo,Codex的灵魂人物,重置卡狂魔,最新这一期The Pragmatic Engineer 对话还是蛮有料的 1. Codex 为什么用 Rust 写,明明模型对 Rust 又不是训练得最好的? Tibo 说这不是为了性能,是为了正确性、安全性和可扩展性。他们很早就把"agent 核心"和"产品界面"当成两码事来设计,核心必须足够健壮。 Rust 编译期的静态校验,对 agent 这种东西特别合适——用同一种语言、缠在同一个代码库里写,早晚会写糙,还会阻碍后面的创新。这道语言边界本身就是一种隔离设计。 2. "harness 总比模型快一步",这句话到底什么意思? Tibo 的解释:模型本身有能力,但你得给它架几根拐杖——护栏、工具、developer message(每轮对话开始时注入上下文的提示),让它把已有能力真正可靠地发挥出来。 具体例子:早期模型不会自动跑单元测试,得靠 harness 提醒它;后来模型自己懂了,这根拐杖就能拆掉。他说的原话是"随着时间推移,developer message 在变小,harness 也在变薄"。 所以 harness 不是终点,是一个会不断被模型吃掉的临时工程,这活儿注定要一直重做。 3. Code review 是不是快没用了? Tibo 说他们做了一个专门的 review 模型,能发现"顺着依赖关系深挖三四层"才能找到的逻辑错误,这种错误人类可能要花好几个小时才能抓到。现在 OpenAI 所有 PR 都要过这一关,一旦标出安全问题直接自动拦截、不让合并。 但他没说 review 没用了,他说角色在变: - 正确性、安全性这些能自动化的会被自动化,人真正该聊的是"这个功能到底值不值得做""架构意图是什么""系统的不变式是什么",而且这种讨论完全可以脱离 PR 提前发生。 一句话总结他的判断:"核心其实是团队要不要就一个盒子的契约达成一致,盒子里面怎么写,没那么重要了。" 4. 维护成本变便宜之后,团队真正改变的是什么? Tibo 强调好的架构和边界依然是关键,能不能快速迭代,取决于当初那道边界画得对不对。 以前一个团队从两三个人涨到五十、一百个工程师要一年,现在一个周末就可能有一百个 agent 同时在给同一套系统贡献代码——这个速度是团队协作和架构设计以前根本没准备过的。 这可能才是这个时代的协作真正需要解决的核心问题
41
4
57
13,314
9 月 10 日,智谱·杭州全城 Coding 计划启动 季卡综合补贴 44%,年卡综合补贴 51% 此活动仅限在杭工作或在杭读书的用户,需提交参保证明或学信网在线验证报告,每人限享一次 Lite 版,官方原价 1416 元 / 年,补贴后 693.84 元 / 年 Pro 版,官方原价 6456 元 / 年,补贴后 3163.44 元 / 年 Max 版,官方原价 12936 元 / 年,补贴后 6338.64 元 / 年 目前看起来只有智谱有优惠,最羡慕杭州的一集
111
6
1,143
卧槽,豆姐放大招了,千呼万唤始出来:Windows 豆包输入法正式上线! 作为一名重度的豆包输入法用户,这个功能对我来说太重要了。链接我放评论区了,需要的朋友们评论区自取
3
3
767
我不好说了兄弟们,到底是小米劈了腿,还是苹果出了轨? 去年买个 17 要愣一下,今年买个小屏折叠旗舰要也愣一下 雷军就差改名 Duo 了
8
1,744
说实话,高强度使用各种大模型的人,一定能明白为什么模型不能随便换了 尼玛一句更好便宜的就把人模型给换了? 做模型的厂商自己不用 AI 吗,我不理解
卧槽,DeepSeek 评论区大翻车 模型静默替换引发争议:技术正确为什么输给了产品契约? 核心不是“Flash 好不好”,而是官方把模型名当成可以后台改写的内部别名,用户却把它当成稳定契约。 工程视角和产品契约在这里发生了严重撞车。 ━━━━━━ 🔹 工程师逻辑 vs 开发者体验 官方视角很顺畅: 👉 V4.1 Flash 在性能、速度、成本和总用时上全面超越 V4 Pro 👉 再按更贵、更慢的 Pro 卖旧模型“不合适” 👉 直接把 V4 Pro 请求切到 Flash,还按 Flash 计费 但开发者看到的却是: ❌ 模型 ID 被静默替换 ❌ 调好的提示词、评测集、Agent 工作流可能一夜变样 ❌ 失去了真正的选择权 💡 高赞回复说得很直白:可以发退役公告、鼓励迁移,但绝对不要替用户做决定。 ━━━━━━ 🔹 ToB 场景:从体验问题放大为信任危局 企业按 Pro 接入、按 Pro 对内汇报。 1️⃣ 突然变快变便宜,老板以为是“对接人优化成功” 2️⃣ 等 V4.1 Pro 上线再变回去,接口变慢,责任全落在对接人头上 3️⃣ 一旦开了“model_id 想切就切”的先例,用户会怀疑背后跑的到底是不是自己选的模型 这和“更好、更便宜”完全是两件事。 💡 B端开发者真正需要的是: ✅ 明确的下线时间表 ✅ 新旧模型并行窗口 ✅ 可自主关闭的路由开关 而不是一句“对用户负责,所以我们替你切了”。
25
1
11
3,299
Agent 开发我跟你拼了,这个月会陆续学习并总结 Agent 开发工程拆解类的文章 另外 DAN KOE 这篇文章值得我们学习 ,践行费曼学习法,每个周期锚定一个领域高强度学习并输出,学习本身也是做自媒体的很棒的一种收获
33
4
37
4,444
Replying to @qianshuixia2026
我连 1/5 都还没到呢虾总 😂
1
23