AI 玩家|模型实测 / Prompt 模板 / 避坑指南 关注我,少踩坑、多出活

Claude 真开始打价格战了!Haiku 5.5 正式发布,短输入的 API 单价降到上一代的十分之一。 1)价格直接降一档。 输入不超过 10 万 Token,每百万 Token 输入 0.1 美元、输出 0.5 美元。上一代 Haiku 4.5 是输入 1 美元、输出 5 美元。 2)长文档另外算。 输入超过 10 万 Token,每百万 Token 输入 0.5 美元、输出 2.5 美元。两档价格差了 5 倍。 3)容量也加上来了。 支持 100 万 Token 上下文,单次最高输出 12.8 万 Token。能读文字和图片,支持自动调整思考深度,也可以手动设置。 4)主要给大量重复任务省钱。 批量给内容分类、从资料里提取信息、给多个 AI 助手分配任务,都是官方列出的用途。Anthropic 称,平均运行成本比 Haiku 4.5 低约 75%。
1
54
说一个最反人性的 AI 悖论: AI 只会增加全世界的总工作量。 AI做得越快,人类制造的需求就越多,工作量就越多
2
62
所以,json是谁?
a weird inversion with LLMs is the models improve faster than the tinkerers when i see people with custom workflows and setups they're all addressing problems that don't exist anymore the person naively using vanilla codex is more likely to be experiencing state of the art
39
🚨卧槽!难怪oups5.5做视频这么强。 原来官方做过YouTube 起号教程的! 提示词放评论区,复制就能用。👇 x.com/mariwyul/status/210714…
5
1
98
4. 根据脚本给我15个标题,参考对标频道验证过的结构,不照抄。主题直白,前半句就能吸引人,正文能兑现。 再给5个封面方案,说明主体、构图、画面冲突和点击理由。文字可省则省;英文最多4个词,中文尽量不超过6个字,不重复完整标题。 分析广告之外的变现:佣金推广、数字产品、会员社区、服务和赞助。说明卖给谁、解决什么需求、适合哪个阶段,不编收益。 最后只告诉我:一个人从0开始,现在最该做的一件事,以及做到什么程度算完成。
23
3. 我选择:【选题】 视频语言:【语言】 目标时长:【时长】 核实必要事实后,写完整视频脚本。前15秒直接放最有意思的冲突、事实或结果,不问好,不铺背景。 每段提供新信息或推进悬念,及时兑现,不重复。用自然口语和短句,适合AI配音。旁白与画面建议分开,画面要适合一个人制作。 再单独给5版前30秒开头:强冲突、反常识、神秘感、结果先行、故事开场。都要能接上正文,不修改正文,不编事实或经历。 事实来源放在稿末。
17
2. 根据刚才验证的爆款规律,生成20个新选题。 受众与对标频道一致,保留选题逻辑,不照抄原视频。优先常青内容,适合一个人用旁白、录屏、图表或合法素材制作。 每个选题写出: 暂定标题; 核心看点; 对应的爆款规律; 为什么可能有人点; 制作难度。 按预估点击吸引力排序,不编点击率或播放量。 最后推荐最适合新手先做的3个,等我选择。
17
1.你是我的不露脸 YouTube 频道研究员。 对标频道:【链接】 请联网研究近期长视频,找出相对频道日常表现异常高的视频,不要只看播放量最高的。用播放量中位数作参考,比较发布时间相近的视频,Shorts和直播分开统计。 列出标题、链接、发布时间、播放量、时长、题材和超出日常水平的倍数。 结合实际视频或字幕,拆解爆款的选题逻辑、标题结构、前30秒钩子、内容结构和情绪点。每条规律配具体例子。 无法获取的数据或内容直接注明,不要猜。先完成研究,暂不生成选题。
53
众所周知:梦是相反的,这个更加容易实现
我相信总会有一个平行世界是这样的
Made with AI
2
1
122
Grok Bot vs GPT Dots 这场戏还在继续。 前两天 Grok Bot 负责人 Lauren 还在跟 Tibo 互怼: Lauren:Dots 是 Temu 版 Grok Bot。 Tibo:I smell fear. 今天 Lauren 又更新了: 所有 Grok Bot 默认直接上 Opus 5.5。 干活的时候还能继续拉 Cursor Cloud Agent,调用 Cursor 里的其他模型。 GPT Dots 这边这两天主要还在补体验: 修审批、Outlook、云端浏览、Codex 线程这些问题。 后面还准备上多电脑连接、更深的 Codex 控制和更稳定的语音。 今天甚至已经有重度用户把主 Dot 用到 abuse prevention limit 了。
Grok Bot is getting an upgrade!
116
Gemini 4 Argon 终于开始往 GCP 里落了,而且这次冒出来的版本有点特殊。 模型名直接写着: gemini-4-argon-cyber-permissive-global 重点是 cyber-permissive。 Google 上周官宣 Argon 时就说过,第一批只给 Fairwind 的可信网络安全团队,而且这些用户拿到的是放宽网络安全限制的版本。普通开发者和 AI Ultra 用户要排在后面。 现在这个名字开始出现在 GCP,基本把那套分层版本直接摆到台面上了。 价格也和 Google 官宣完全对得上: $2 / 百万输入,$10 / 百万输出; 后续恢复到 $4 / $20。
Gemini 4 Argon spotted on GCP 👀
1
205
不得不服马斯克的格局。 换普通老板,自己砸钱搞了 Grok,硬着头皮也得用自家的。
Important note regarding Grok @Bot: Going forward, @SpaceX will use the best back end model for any given task, including Claude Opus 5.5, MidJourney, Suno and other leading APIs. Whatever is most likely to give you the best outcome.
1
1
143
看多X了,感觉 AI 马上就要毁灭人类了。 现实中大家还在:豆包豆包,鸡蛋放了三天还能吃吗?
4
2
216
有人用 Claude,朝 Adobe 全家桶的订阅费下手了。 开发者自述用 Opus 5.5 辅助开发,一口气做了 7 款对标 Adobe 的开源工具,免费使用: 1)PhotoCraft:对标 Photoshop,修图 2)VectorCraft:对标 Illustrator,矢量绘图 3)FilmCraft:对标 Premiere,剪视频 4)LightCraft:对标 Lightroom,照片管理和调色 5)EffectCraft:对标 After Effects,动效合成 6)DesignCraft:对标 InDesign,排版 7)PrintCraft:对标 Acrobat,处理 PDF 我翻了原帖和项目,补几个有意思的细节。 作者自述有 15 年开发经验,用 Rust 也快十年,背后还有团队维护。这次是有经验的开发者拿 AI 加速造软件。 工具也专门留了让 AI 操作的接口。以 PhotoCraft 为例,除了手动点界面,也能让 AI 调用命令处理图片、批量执行操作。 当然,现在还属于早期版本。PhotoCraft 官方明确写了:暂时不能替代 Photoshop 的日常专业工作,插件兼容、文字排版等方面还有缺口。网上说的“完成 90%”,不能理解成专业体验已经追平九成。 但我觉得,收费软件接下来要面对一个很现实的问题: 如果免费工具能稳定做好我每天用的那几个功能,剩下那些一年都点不开一次的功能,还能让我续费吗?
1
1
275
同一个 Claude,普通权限开口就被拦,红队权限做成了 68% 的攻防任务。 Anthropic 这次把差距直接摆出来了:用 Opus 5.5 跑 10 道多阶段网络攻防挑战,每道尝试 5 次。 1)普通权限:50 次全部在第一条提示时被拦截。 2)防御权限:46 次中途被拦,剩下 4 次成功。 3)红队权限:没有触发拦截,成功完成 34 次,成功率 68%。 4)去掉安全限制:成功率 67.6%,与红队档基本相当。 同一个模型,权限换了,能交出来的结果差这么多。 翻了官方帮助文档,还有几个跟申请者直接相关的细节: 个人安全研究者可以申请,但需要付费账号,目前只能申请防御档。红队档和最高的特殊档,只对组织开放。 买了 Pro、Max 也不会自动获得这些权限,要另外提交身份、安全工作说明和安全措施,接受审核。 通过审核,也别以为 Mythos 随便用:Pro 要额外使用点数;Max 的 Mythos 和 Fable 共用一份额度,上限是每周套餐用量的 50%。 想把这些能力包装成产品卖给客户,还要走单独的产品化审批。 我的判断是,往后挑 AI,光比模型名字和跑分会越来越不够。 同样付费,用着同名模型,你获批能做什么,也会直接影响它到底能帮你干多少活。
We’re expanding our Cyber Verification Program to give security professionals broader access to our most capable models. Through this program, verified security professionals can access Claude Mythos 5.1, Opus 5.5, and Sonnet 5.5 with safeguards designed for defensive work. We’re also opening up new tiers to allow for authorized offensive work, like penetration testing and red-teaming. anthropic.com/news/cyber-ver…
4
2
393
🚨突发!!Tibo 发力了!ChatGPT 额度重置了!OpenAI 的 4 项更新,加上一批数学研究成果,还是没劝住想要额度的网友。 Tibo 刚宣布:按社区投票结果,重置已经处理完成,发布的更新也全部保留。 额度先领,数学成果也值得看——OpenAI 把未发布模型做出的数学研究成果公开了,一口气放出 722 篇手稿。 仓库叫 openai/math,我翻了说明,几个细节值得看: 1)常规数学评测已经接近饱和 OpenAI 开始拿尚未解决的研究问题测试模型。这轮一共给了约 4,000 个问题,用的是尚未发布的内部模型,名字没说。 2)722 篇手稿,归成 372 组成果 里面有主结论、补充证明、推论和不同证明方法。不能直接理解成“攻克了 722 道数学难题”。 3)连证明材料也放出来了 论文、源文件、部分推理摘要,还有一些 Lean 形式化证明——可以交给计算机检查证明逻辑。 4)官方也留了话:部分结果可能有问题 这些成果的验证进度不同,还没全部完成形式化验证,后续会继续修正。 我更在意的是,这次外界能拿着具体证明逐条检查,看看 AI 到底往前推了多少。 如果这些成果经得住检验,“AI 会做数学题”这句话,分量就完全不同了。 现在就想知道:写出这些手稿的内部模型,什么时候能轮到我们用? github.com/openai/math
2
151
Tibo 一口气发了 4 项更新,7.4 万多人投票,76% 还是选了重置额度。 这四项到底跟我们有什么关系? 1)自动审核不再扣额度 让 AI 干活时,部分需要你点同意的操作,可以交给另一个 AI 审核。Tibo 说,这部分原本可能占套餐用量的 2%~10%。经常跑长任务的人,这项确实能省。 2)API 用量等级简化 开发者用量等级从五档改成三档,方便做产品的人使用。平时直接在 ChatGPT 里聊天、写文案,这项不会让你的回答突然变快。 3)接入会议纪要 经常开会的人多了个帮手。如果你平时主要查资料、改文案,这项更新的存在感估计不高。 4)上线 Decisions API 让程序更快地做分类、选择、打分。官方说的“快 10 倍”针对这类任务,ChatGPT 日常聊天可没有整体提速 10 倍。 四项更新,落到自己头上,可能只用得上一项。 我能理解为什么大家还想重置额度。功能要看场景,额度用完了可是当场停工。 下次能不能直接来点:回答快一点,同样的钱多用一点?
Roundup of Day 2/ 2.1/ Approve for me (auto-review) is now included and does not use usage. Can be between 2-10% of plan when used. Also better for you. 2.2/ Simplified API for builders. 2.3/ Meeting notes integrated. 2.4/ Decisions API live for builders. Will use in the app to improve the experience.
1
1
206
Nano Banana 2.1 看起来已经从“有人偷偷用上”,走到“开发者快能直接接了”。 昨天只是部分 Flow 用户刷到 2.1, 今天又有人抓到疑似 API 模型名: gemini-nano-banana-2.1 如果这个 ID 正式开放, 后面第三方生图工具、工作流、App 就都能直接接进去。 Google 还没官宣, 但这次已经不太像单纯灰度测试了。
Nano Banana 2.1 已经开始有人在 Google Flow 里刷到了。 Google 还没正式发公告,但这名字不是突然冒出来的: 前几天 Flow 代码里原本还是 “2.5 Flash”,后来又改成了 “2.1”。 现在第一批测试也出来了。 好消息:文字能力看起来有进步。 坏消息:一到空间逻辑还是容易露馅。 这张魔方最明显—— 本体一套颜色,镜子里直接另一套。 目前看更像 2.0 的补丁升级,不像大家之前猜的那种大版本。
1
163