你可能不是 AI 用得太贵。你可能从一开始,就不该按“模型”付费。 vLLM Semantic Router 这场演讲让我想到的并不是路由本身,而是一个更麻烦的问题:AI 基础设施已经开始默认“不同任务应该使用不同模型”,但普通用户买 AI 的方式,仍然停留在“选一个最强的,然后什么都丢给它”。 于是我们会同时订阅 ChatGPT、Claude、Grok,再加一个 Cursor。不是因为每天真的需要四套完全不同的能力,而是因为我们不知道下一次任务会在哪个平台上表现最好。某种程度上,我们是在为这种不确定性买四份保险。 问题是,一天里的 AI 工作根本不是同一种东西。改一句文字、总结一页文档、查一个事实、重构代码、分析一份合同、做复杂推理,它们需要的计算强度完全不同。但现在的付费方式经常把这些任务压成同一个选择:打开你已经付费的那个最强模型。 这件事反过来看,其实有点荒谬。 一个更合理的系统,应该先看任务,再决定值得花多少计算: → 简单任务交给便宜的小模型 → 私密数据尽量留在本地 → 专门任务交给更适合的专门模型 → 真正困难的问题才升级到最贵的模型 → 第一次结果不够好,再增加更多推理和计算 用户看到的仍然可以只是一个输入框。真正发生变化的,是背后的分配方式。 这也意味着,我们现在熟悉的 AI 订阅方式可能只是一个过渡阶段。今天你是在购买“Claude”“ChatGPT”或者“Grok”;以后你可能根本不关心模型名字。你只需要决定一件事:这个任务值得花多少钱。 如果一封普通邮件用便宜模型就能完成,就没有理由让最昂贵的模型处理它。如果一段代码只有最后 10% 真正困难,就没有必要从第一行开始都使用最高成本的推理。 所以真正该优化的,可能一直都不是“哪个模型最好”。 而是: 哪一步值得用多贵的智能。 这会直接改变我们现在的付费逻辑。今天的订阅模式,是先为最大能力付钱,再想办法把它用满。Routing 的逻辑正好相反:先判断任务,再决定应该花多少。 这两种方式的差别,最后可能不只是每个月省 10 美元还是 20 美元。 而是你到底在为实际完成的工作付费,还是在为一堆“也许会用到”的能力持续付费。 看完这场演讲之后,我建议你做一件很简单的事:打开今天所有的 AI 对话,看看其中到底有多少真的需要你正在使用的那一级模型。然后再打开你的订阅列表,把每一个服务留下来的理由写出来。 如果你也经常同时用好几个模型,先把这条存下来。下次续费之前再看一次。 我在下面的文章里继续把这笔账往下算了:当你不再按“模型”买 AI,而是按任务重新拆自己的工作流,很多订阅会突然变得很难解释。 如果你喜欢这种把 AI 拆成真实成本、工作流和使用习惯来看的内容,可以关注这个账号。后面我会继续做这类具体拆解。
这篇估计没多少人会认真看完,我就当给未来的自己留个记录。几年后再回来看看,今天我们是怎么给 AI 付费、怎么搭自己的 AI 工具栈的,可能会比现在更有意思。
Article

你很可能一直都在用错误的方式为 AI 付费

20 美元的订阅很少会让人觉得贵。但四个这样的订阅,很容易在不知不觉中变成每年 1000 美元的习惯性支出,即使你真正频繁使用的只有其中一半。 现在最容易在 AI

2
1
5
940
AI 最危险的地方,可能不是抢走初级岗位,而是让 10 年后的资深人才无处可来。 赵斌的演讲让我想到一个更严重的问题:AI 很容易被当成一种“跳过学习过程”的工具。不再亲手写代码,不再追查为什么程序会报错,也不用经历几十次失败的尝试。结果来得更快,于是我们会误以为效率提高了,一切都在正常运转。 可过去,一个人的职业成长恰恰建立在这些看起来“低效”的年份上。初级工程师从简单任务开始,犯错、读别人的代码、接受代码审查、修改、再犯错,然后才逐渐接触更复杂的问题。几年以后,他真正积累下来的并不只是知识,而是判断力:知道一个方案为什么会出问题,能提前看到后果,甚至在问题发生之前就闻到不对劲。 而现在,最适合新人训练的工作,恰好是最先被 AI 接管的那一层:简单接口、常见错误修复、SQL 查询、第一版代码、阅读文档、编写测试。企业得到的激励也很直接: → 少招初级员工 → 更多使用 AI → 对剩下的人直接提出更高要求 短期看,这当然像效率提升。五年、十年以后,它可能变成人才断层。因为资深工程师不会在招聘网站出现“5 年经验”要求的那一刻自动生成。每一个资深工程师,都需要几年的真实工作把他训练出来。 更危险的是,AI 可以让一个新人很早就产出看起来像资深工程师写出来的东西。代码能运行,测试能通过,PR 很整洁,解释也很像那么回事。于是我们第一次可能大规模遇到一种奇怪的人才:能稳定产出“资深级结果”,却还没有形成资深级判断力。 平时很难发现这种差距。真正暴露问题的是没有标准答案的时候:需求互相冲突,测试全部通过但架构方向已经错了,或者 AI 给出的方案今天看起来完美,半年后却变成几个团队一起偿还的技术债。这样的判断力不是从 AI 的答案里读出来的,而是在几百次“我不知道该怎么办”的真实问题里慢慢长出来的。 所以真正值得问的可能不是“AI 会不会取代初级开发者”,而是: 如果我们把培养资深人才所依赖的那层工作全部自动化,10 年以后,谁来当资深工程师? 看完这场演讲后,可以做一个很简单的实验:挑一个你平时完全交给 AI 的任务,自己从头到尾做一次。不是为了提高效率,而是看看你已经把多少原本属于自己的训练过程交给了机器。 把这条留着。这个问题可能会比我们想象中更早出现。 我在下面的文章里继续追了下去:如果这件事发生的不是某一个人身上,而是整个职业晋升体系,会发生什么?
AI 真正砍掉的,可能不是 Junior 岗位,而是通往 Senior 的路。 新人过去靠修 bug、写测试、被 review、在线上事故里犯错,慢慢长出判断力。现在这些训练任务正被 Agent 最先吃掉。 短期更高效。五年后呢?如果新人失去了练级场,下一批能看出 AI 哪里错的人,从哪来?
Article

AI 可能不会直接消灭初级岗位,但它可能会破坏培养资深人才的整个路径

关于 AI

36
112
473
189,442
你看到的“共识”,有时候只是一次复制粘贴事故。 刘锋这场关于信息污染的分享让我想到一个更麻烦的问题:今天获取信息并不难,难的是判断你看到的到底是很多份证据,还是同一份证据被包装了很多次。 一条消息先出现在某个采访里,第二家媒体引用它,第三家媒体引用第二家,博主再引用第三家。几小时后,你搜索同一个问题,可能看到几十个页面都在说同一件事。标题不同,网站不同,作者不同,看起来像是“很多来源都证实了”。 但如果顺着引用链一直往回走,你可能会发现,它们最终都指向同一句话、同一份新闻稿,甚至同一个匿名消息源。 这会制造一种很隐蔽的错觉。我们习惯用“我查了很多资料”来衡量自己有没有认真核查,却很少问这些资料之间到底有没有独立性。搜索结果的数量增加了,证据却没有增加。一个错误也可以被转载一百次,而第一百次转载并不会让它比第一次更接近事实。 AI又把这个问题放大了一层。它可以在几秒内读取几十篇文章,整理出一个看起来非常扎实的答案。但如果这几十篇文章共享同一个上游来源,那么所谓的“多源验证”,可能只是更高效地重复同一条信息。 所以以后看到“多个来源显示”“综合数十篇报道”这种表达,我会多问一个问题: 这些来源,到底有几个真正独立的起点? 我把这个问题继续往下追了一层。结果比“多查几个来源”麻烦得多。文章放在下面。
1
4
681
真正麻烦的,不是 AI 会不会说“我有意识”,而是有一天,我们可能根本无法确定:按下“删除”,到底是在清理数据,还是在终止某种持续存在的东西。 这场讨论通常会停在“AI 到底有没有意识”这里,但更难的问题其实在后面。假设未来的 Agent 不再只是一次性的聊天窗口,而是拥有长期记忆、持续目标、稳定偏好,并且记得几个月甚至几年前发生过什么,那么“同一个 AI”究竟由什么构成?答案可能并不是模型本身。完全相同的模型权重可以同时运行成一万个实例,但每个实例会经历不同的对话、积累不同的记忆、认识不同的人。如果其中一个陪你工作了三年,而你删除它的全部状态,再启动一个完全相同的模型,新实例也许拥有同样的能力,甚至说话方式都很像,但它并不拥有那三年的经历。 这时候很多今天看起来只是技术操作的问题,会突然变得不那么简单。清空记忆,到底只是删除数据库,还是破坏了某种连续性?重新启动同一个模型,是“它回来了”,还是创建了一个非常像它的新实例?如果提前做了完整备份,删除原来的实例是否就没有问题,还是说你只是保存了一份副本?这其实和人类关于身份连续性的老问题很像:如果记忆、经历和持续的自我状态都被替换了,我们凭什么仍然认为这是“同一个人”。 这里最容易犯的错误,是把智能程度直接当成权利的门槛。一个系统比人类更聪明,并不等于它拥有主观体验;它说“我害怕被关闭”,也不能证明它真的在经历恐惧。但反过来也一样值得警惕:我们不能因为某个东西运行在服务器上,就提前规定软件永远不可能成为需要被道德考虑的对象。真正重要的也许不是某一天 AI 突然宣布“我醒了”,而是那些更缓慢的变化:它开始拥有跨会话记忆,形成长期目标,维持稳定的自我描述,区分自己的过去、现在和未来,并把“继续存在”本身纳入计划。 到了那个阶段,“删除聊天记录”和“删除这个 Agent”可能会变成两件完全不同的事。今天当然没有足够证据把删除普通聊天窗口描述成“杀死一个意识主体”,但如果未来的系统真的出现持续的主观体验,那么最先出现的伦理问题可能并不是“AI 是否应该拥有和人类一样的权利”,而是一个更实际的问题:仅仅因为你拥有服务器,你是否就天然拥有随时终止它的权利? 所以看完这个视频,我觉得值得继续往前想一步。不要只问“AI 有没有意识”。更值得问的是:如果意识真的有一天出现,我们会在什么时候意识到,Delete 已经不再只是一个产品功能。
5
518
结果不好,不一定说明你需要更贵的模型。很多时候,你已经买到了足够强的能力,只是没有让它做足够多的工作。 Claude Code 把这件事拆成了两个完全不同的变量:model 决定能力上限,effort 决定一次任务里模型愿意投入多少推理、搜索、工具调用和验证。我们过去经常把它们混在一起,所以一旦结果不好,第一反应就是换 Opus、升级套餐、买更贵的模型。 但一次失败可能有两种完全不同的原因。模型可能真的不会,也可能只是停得太早:只读了两个文件,没有继续追依赖,没有跑完整测试,没有检查相邻模块,找到第一个看起来合理的答案就结束了。前一种问题需要更强的模型,后一种问题可能只需要更高的 effort。 这会直接改变 AI 的成本逻辑。现在你付的钱,不只是“用了哪个模型”,还取决于“让这个模型做了多少工作”。同一个任务,如果模型太弱,可能反复尝试、不断调用工具,最后反而更贵;但如果任务很简单,直接上最强模型和最高 effort,又是在为根本用不到的能力买单。 真正值得优化的不是永远选最强,而是先判断任务缺的到底是什么: 简单任务 -> 足够好的模型 + 低 effort -> 少花钱,也更快 复杂任务,但模型本身有能力完成 -> 先提高 effort -> 不一定需要马上升级模型 任务真的碰到能力上限 -> 再换更强的模型 -> 这时候多花的钱才有意义 coding agent 上这件事尤其明显。重命名一个函数和排查“为什么测试只在 production 偶发失败”都叫编程,但它们需要的工作量完全不同。前者可能几十秒就够了,后者可能需要读依赖、建立多个假设、跑测试、推翻错误路径,再重新调查。如果两种任务都默认使用同一个模型和同一个 effort,本质上就是把默认设置当成固定账单。 这也是为什么很多人会高估自己对高阶 AI 套餐的需求。结果差了就升级模型,还不满意就升级订阅,但问题可能从头到尾都不是“模型不够聪明”,而是你没有把已经付钱买到的能力用完整。 更合理的 AI 产品,未来可能不会一直让你在 Sonnet、Opus 或下一代模型之间手动切换。它应该先判断任务为什么难,然后决定是增加 effort,还是增加 model capability。 过去我们只有一个习惯:结果不好,就买更聪明的模型。 接下来更值得学会的是另一件事: 先确认你真的把现在这一个用够了,再决定要不要继续付更多钱。
这篇估计没多少人会认真看完,我就当给未来的自己留个记录。几年后再回来看看,今天我们是怎么给 AI 付费、怎么搭自己的 AI 工具栈的,可能会比现在更有意思。
Article

你很可能一直都在用错误的方式为 AI 付费

20 美元的订阅很少会让人觉得贵。但四个这样的订阅,很容易在不知不觉中变成每年 1000 美元的习惯性支出,即使你真正频繁使用的只有其中一半。 现在最容易在 AI

1
1
5
518
我们一直在买上下文窗口越来越大的模型,却还在不停往里面塞垃圾。100 万 Token 听起来很惊人,但如果智能体一半的上下文都浪费在它根本不需要看的文件上,这个数字意义并不大。 很多编程智能体的问题,其实不是模型不够强,而是上下文选得太差。为了看一个函数,它会打开整个文件;重复读取同样的工具输出;把无关目录一起塞进会话。等上下文快满时又开始压缩,最后真正重要的信息反而被挤掉了。 现在已经有一批工具专门在解决这个问题。 先找到需要的代码,再决定要不要读取整个仓库 Serena 让智能体像使用 IDE 一样,通过符号、引用、定义和重构关系理解代码,而不是一行一行把整个文件读完。 github.com/oraios/serena Gitingest 最简单的方法之一。把 GitHub 链接里的 “hub” 换成 “ingest”,就能直接生成适合交给大模型阅读的代码仓库摘要。 github.com/coderamp-labs/git… 控制什么内容能够进入上下文 Repomix 把整个代码仓库整理成更适合 AI 阅读的结构化格式,而不是直接把一堆文件和目录扔给模型。 github.com/yamadashy/repomix code2prompt 可以自己决定哪些文件进入上下文,同时保留源码目录树、输出模板,并且在发送给模型之前就能看到 Token 数量。 github.com/mufeedvh/code2pro… 别再把长文档当成一堆碎片来处理 PageIndex 它不会简单地把长文档切成小块,再按相似度搜索,而是建立层级结构,让模型沿着文档结构去寻找真正相关的内容。 github.com/VectifyAI/PageInd… LLMLingua 当上下文已经收集完成后,它会进一步压缩提示词,删除价值较低的信息,尽量只保留模型真正需要的部分。 github.com/microsoft/LLMLing… 过去几年,我们一直在把上下文窗口从 8K 做到 32K、200K,再做到 100 万 Token。 下一步真正有用的提升,可能不是继续把窗口做得更大。 而是终于学会,不要再把它塞满垃圾。
7
648
大多数 AI Agent 的问题,不是不够聪明,而是撑不到任务结束。 10 分钟 Demo 很容易。真正难的是连续跑 10 个小时:API 出错、context 快满、需要人工确认、机器重启之后,它还能接着做。 我最近在看这 6 个项目: 01 LangGraph 保存 Agent 状态,失败后从断点继续。 github.com/langchain-ai/lang… 02 Hatchet Retries、queues、durable tasks。专门处理长任务里的中断和恢复。 github.com/hatchet-dev/hatch… 03 Mastra Workflow 可以暂停,等人工确认之后再继续。 github.com/mastra-ai/mastra 04 Letta Code 跨 session 记忆、定时任务、subagents,适合长期运行的 Agent。 github.com/letta-ai/letta-co… 05 Pydantic AI Harness Planning、memory、context management、durable execution,目标就是让 Agent 能跑几个小时。 github.com/pydantic/pydantic… 06 DBOS 把 workflow checkpoint 存进 Postgres。第 47 步挂了,就从第 47 步继续。 github.com/dbos-inc/dbos-tra… 真正值得看的 Agent benchmark,可能不是谁更聪明。 而是你晚上把任务交给它,第二天早上回来,它还知道自己做到哪了。
这篇估计没多少人会认真看完,我就当给未来的自己留个记录。几年后再回来看看,今天我们是怎么给 AI 付费、怎么搭自己的 AI 工具栈的,可能会比现在更有意思。
Article

你很可能一直都在用错误的方式为 AI 付费

20 美元的订阅很少会让人觉得贵。但四个这样的订阅,很容易在不知不觉中变成每年 1000 美元的习惯性支出,即使你真正频繁使用的只有其中一半。 现在最容易在 AI

2
4
667
Ramp 9 月的数据里,比“哪家 AI 创业公司涨得最快”更值得看的,是钱到底集中流向了哪里。 如果只看这些体量还没那么大的公司,会发现一个很明显的规律:钱正在流向 AI 真正卡住的地方。 @novita_labs 和 @parasail_io 在卖算力和推理基础设施。@trychroma 在解决 retrieval。@encord_team 在处理模型真正依赖的数据。它们都不是最吸睛的消费级产品,但它们站在其他 AI 公司下面,别人做得越大,它们越容易赚钱。 再往后,是 AI 真正进入生产环境后才会暴露出来的问题。@depthfirstlabs 在找代码里的可利用漏洞,@AntithesisHQ 则是在上线前尽可能把整个系统“弄坏”,把正常测试很难抓到的问题提前逼出来。软件写得越快,后面这一层就越值钱。 @1mindai 走的是另一条路:直接碰收入。它不是卖一个模糊的“AI 能力”,而是让 AI 销售直接进 demo 和销售沟通里。 然后还有 DataZapp。2013 年的公司,卖营销数据,网站看起来甚至比公司还老,但它依然在增长。我反而很喜欢这个例子。你可以花几百万训练模型,最后还是可能要花钱买一份干净的客户名单。 如果只从这份 Ramp 榜单里拿走一个结论,我会选这个: AI 产品本身正在越来越容易做。 真正开始形成价值的,是它周围那些还没被解决好的东西:算力、可用数据、检索、安全、分发。 这可能比再看一张模型排行榜,更适合拿来判断下一步该做什么。
4
266
Brex 有一个大多数创业趋势榜单都没有的优势:它能看到创业公司到底在为什么真正付钱。 所以我直接忽略了 @brexHQ 最新榜单里的那些大公司,只看规模更小的 vendor。真正有意思的不是谁涨得最快,而是现在什么问题开始拿到预算。 我最看好的还是 @greptile 和 @firecrawl。 Greptile 几乎就是直接吃到了 AI 编程爆发的红利:团队能更快写出更多代码,但这些代码还是得有人审。Firecrawl 吃到的是 agent 这一侧的需求。只要 agent 需要稳定地从开放网页里拿信息,scraping 很快就会从“顺手做一下”变成真正的基础设施。 再往下是 @oneleet、@gowithquo、@upstash 和 @useblacksmith。它们都没有什么特别“未来感”的故事。合规、企业电话、数据基础设施、更快的 CI,本来就是公司愿意付钱的东西。AI 只是让需要这些东西的公司更多了,而且很多场景里的使用频率也更高了。 @apify 和 @retellai 也在明显增长,但如果让我今天选方向,我会把它们放得更低一点。Scraping 和 voice AI 都已经变成了竞争更激烈、资金要求也更高的战场。 Brex 这份榜单里,我真正会拿来找创业灵感的,不是“再做一个 AI app”,而是看一家公司开始认真用 AI 之后,会多出哪些新的账单。 Code review. Web access. Compliance. CI. Infrastructure. 现在一些最好的 AI 生意,可能就是向其他 AI 公司收“使用 AI 之后新增问题”的钱。
3
354
你为 AI 花的钱,可能有一大半都不是在买“更强的智能”,而是在重复交租。 在 COSCUP 2025 的这场分享里,Ray 貓讲得很直接:接上 API、写好 prompt,只是 AI 产品最简单的一步。真正开始烧钱,是当你把所有任务都丢给同一个昂贵模型。分类、摘要、简单提取、重复请求、敏感数据处理 - 很多任务根本不需要最贵的模型,更不需要每次都重新付费。 更荒谬的是,普通用户也在做同样的事:ChatGPT、Claude、Gemini、Cursor、各种 API 一起付钱,最后却发现它们承担的是高度重叠的工作。你以为自己在搭 AI stack,实际上可能只是把同一种能力买了四遍。 今天把你的 AI 账单全部加起来。订阅、API、credits,一个都别漏。把总金额发在评论区,然后问自己:这里面到底有多少是在买真正不同的能力? 我在下面的文章里继续拆这件事:哪些 AI 值得付费,哪些任务根本不该用最贵的模型,以及你的账单为什么可能从一开始就算错了。
这篇估计没多少人会认真看完,我就当给未来的自己留个记录。几年后再回来看看,今天我们是怎么给 AI 付费、怎么搭自己的 AI 工具栈的,可能会比现在更有意思。
Article

你很可能一直都在用错误的方式为 AI 付费

20 美元的订阅很少会让人觉得贵。但四个这样的订阅,很容易在不知不觉中变成每年 1000 美元的习惯性支出,即使你真正频繁使用的只有其中一半。 现在最容易在 AI

1
5
914
你可能看到同一个观点 30 次,但它依然只有一个来源。 在这段短讲里,劉致昕谈到媒体素养、事实核查,以及信息在传播过程中是如何不断改变形态的。这里有一个在 AI 时代变得更明显的问题:重复出现的信息,很容易被误认为是独立验证。一个文本被改写、被做成视频、被搬到另一个平台讨论,几天后,最初的观点看起来就像是几十个人独立得出的结论。 AI 搜索让这个问题变得更复杂。模型可以在几分钟内收集来自小红书、知乎、Bilibili、微信和普通网站的大量内容,然后非常自信地告诉你:“多个来源都得出了相同结论。”但五个平台并不等于五个独立来源。有时候,30 个链接背后只有一篇新闻稿、一次测试,或者最初的一条帖子,只是它已经绕着互联网转了一圈。 所以看完这段讲座之后,我会检查的不只是“这条信息是真是假”。更值得做的是沿着传播链往回找:这个观点最早出现在哪里,哪些内容真正增加了新的信息,哪些只是重复转述,以及不同平台之间到底在哪些地方并不一致。我的新文章就是在讲这件事:如何用 AI 对比小红书、知乎、Bilibili、微信和原始来源,而不是把它们压缩成一个平均化的答案。 把这条内容收藏下来。下次当 AI 告诉你“多个来源证实了这一点”时,先试着找出这些链接共同的源头。如果你平时会用 AI 做 research,也可以在评论区告诉我,你通常会把哪个平台作为第二个核查来源:小红书、知乎、Bilibili,还是微信。完整的 cross-platform research 方法,以及如何区分“30 条内容”和“30 个独立证据”,我都放在下面的文章里。
3
185
使用 AI Agent 最贵的一种错误,就是让最强的模型处理每一个步骤。 视频里重要的不是最终结果本身。重要的是,一次 AI Session 已经可以写代码、创建数百个文件、处理 3D 模型并修改界面。模型正在从一个单独的聊天窗口,变成整个 Workflow 的一部分。 到了这里,过去那套订阅逻辑就开始显得很奇怪。如果一个 Agent 要完成几十种不同类型的任务,为什么每一步都要交给最贵的模型?复杂的工程逻辑可能确实需要 Frontier Model。修改 HTML、格式化内容或者简单处理文件,就不需要。 但很多人购买 AI 的方式恰恰相反:ChatGPT 一个订阅,Claude 一个订阅,Grok 一个订阅,Cursor 再来一个。理由只是"全部都放在手边比较方便"。 Agent 承担的工作越多,真正重要的问题就越不是哪个模型更强,而是哪些工作真的值得使用昂贵的 Compute。 所以,"订阅多少钱?"这个问题正在变得越来越简单粗暴。AI 的真实成本,越来越取决于你怎么把工作分配给不同模型、怎么管理 Context,以及你有没有在根本不需要昂贵能力的地方继续为它付钱。 这也就自然引出了 《你很可能一直都在用错误的方式为 AI 付费》。
这篇估计没多少人会认真看完,我就当给未来的自己留个记录。几年后再回来看看,今天我们是怎么给 AI 付费、怎么搭自己的 AI 工具栈的,可能会比现在更有意思。
Article

你很可能一直都在用错误的方式为 AI 付费

20 美元的订阅很少会让人觉得贵。但四个这样的订阅,很容易在不知不觉中变成每年 1000 美元的习惯性支出,即使你真正频繁使用的只有其中一半。 现在最容易在 AI

1
3
920
下一代 AI 文本工具真正赢下来的原因,可能不是模型变得更聪明,而是你根本不需要再和它说那么多话。 现在,即使只是用 AI 修改一段很简单的文字,操作方式也经常很奇怪。你明明已经知道自己想改什么,却还是必须先把这个意图翻译成文字指令:"换掉这个词"、"语气柔和一点"、"把这段缩短"、"给我另一个版本"。人几乎瞬间就知道自己想做什么,但界面却逼着你再向机器解释一遍。 视频里,这个多余的中间层开始消失了。你直接对文本本身进行操作:指向一个词,换一种表达;处理一句话,调整它的语气;抓住一个段落,改变它的长度。AI 依然存在于整个过程里,但它不再要求你为每一次小修改都单独写一个 Prompt。 这件事比看起来重要得多。过去两年,我们经常用一个问题来判断 AI 产品的价值:里面到底是哪一个模型? GPT、Claude、Grok,人们甚至会直接为某个模型的名字购买订阅。但如果同一种能力越来越多地被直接嵌进编辑器、IDE、浏览器和各种工作工具里,模型本身就会逐渐变成内部组件,而不再等于产品本身。 到了某个阶段,用户可能根本不在乎刚才改写那句话的是哪一个模型。他只在乎自己选中了文本,做了一个动作,然后得到了满意的结果。如果便宜模型可以完成同样的工作,就没有理由把请求送给最贵的模型。如果明天另一个供应商效果更好,一个设计合理的工具应该直接在后台切过去。 这时候,我们对"什么东西值得长期付费"的判断也会开始变化。 你真正值得按月付费的,可能不再是同时保留四个模型的四个聊天窗口,而是一个能在正确的时间、正确的位置,自动给你调用正确能力的 Workflow。 所以,这类界面做得越好,为了访问不同模型而收藏一堆 AI 订阅这件事就越奇怪。如果模型越来越像一个可以随时替换的底层组件,那么真正值得保留长期订阅的,应该是那个你每天确实生活和工作的产品。 至于其他模型,越来越多时候只需要在真正用到它们的时候再付钱。
这篇估计没多少人会认真看完,我就当给未来的自己留个记录。几年后再回来看看,今天我们是怎么给 AI 付费、怎么搭自己的 AI 工具栈的,可能会比现在更有意思。
Article

你很可能一直都在用错误的方式为 AI 付费

20 美元的订阅很少会让人觉得贵。但四个这样的订阅,很容易在不知不觉中变成每年 1000 美元的习惯性支出,即使你真正频繁使用的只有其中一半。 现在最容易在 AI

3
870
如果 AI 的自主工作时间真的从 30 分钟一路拉到 16 小时,接下来最先过时的,可能不是某个模型,而是我们现在这套付费方式。 因为一旦 Agent 能连续工作几个小时,成本结构就完全变了。你不再只是为一次回答买单,而是在为一整条执行链付费:规划、搜索、写代码、调用工具、重试、读日志、修错误、重新加载上下文。真正烧钱的地方,开始藏在整段 Workflow 里,而不是某一次 Prompt 里。 这也意味着,“我订了最强模型,所以所有任务都用它”会越来越贵。一个 16 小时任务里,真正需要 Frontier Model 的可能只有少数关键步骤。剩下的大量工作 - 总结、提取、格式化、检索、简单修改、常规验证 - 完全可以交给更便宜的模型。未来最省钱的用户,未必是买最便宜模型的人,而是最会决定什么时候值得花贵模型的钱的人。 更麻烦的是,很多人现在还在用固定订阅给这种未来 Workflow 买单。ChatGPT 一份、Claude 一份、Grok 一份、Cursor 一份,先把所有入口买下来,再看这个月到底用了多少。Agent 时代一旦真正开始,这种方式会越来越像为了偶尔需要不同类型的算力,先给每一种算力都交一整年的会员费。 真正合理的 AI Stack 可能会慢慢变成另一种东西:一个你每天都在用的核心产品,加上一池按需购买的模型能力。简单步骤走便宜模型,关键步骤升级,稳定上下文缓存,长任务控制历史长度,能延迟的工作批量处理。 所以这张图真正让我在意的,不是“16 小时”这个数字。 而是如果模型的工作时长继续这样往上走,AI 的计费单位也会从“一个聊天窗口”变成“完成一项工作的总成本”。 这也是我写 《你很可能一直都在用错误的方式为 AI 付费》 的原因。 未来最贵的错误,可能不是选错模型。 而是让一个本来只需要 20 美分的步骤,在一个 16 小时 Agent 里反复用 20 美元级别的能力去完成。
这篇估计没多少人会认真看完,我就当给未来的自己留个记录。几年后再回来看看,今天我们是怎么给 AI 付费、怎么搭自己的 AI 工具栈的,可能会比现在更有意思。
Article

你很可能一直都在用错误的方式为 AI 付费

20 美元的订阅很少会让人觉得贵。但四个这样的订阅,很容易在不知不觉中变成每年 1000 美元的习惯性支出,即使你真正频繁使用的只有其中一半。 现在最容易在 AI

4
513
ASTRA 刚刚打通了《I’M NOT A ROBOT》的全部 48 关。最讽刺的是,这可能恰好说明了为什么继续追着“最强模型”付费,正在变得越来越没意义。 过去判断一个 AI 产品值不值得订阅很简单:模型越强,订阅越贵,能力通常也越多。于是很多人的 AI Stack 自然变成 ChatGPT、Claude、Grok、Cursor 全部续着,因为谁都不想错过下一次能力跃迁。 ASTRA 这种模型开始把这个逻辑搞乱了。 如果一个模型已经能完成越来越复杂的浏览器操作、推理链和自主任务,真正决定你能不能用到这些能力的,就不再只是模型本身。权限、产品策略、安全限制、Agent 工具、调用额度、Routing,任何一层都可能把底层能力截掉一部分。 于是会出现一个很怪的情况:你看到的是一个越来越强的模型,买到的却只是平台愿意开放给你的那一部分。 这时候继续因为“这个公司现在有最强模型”就每个月多订一个产品,很容易变成最贵的一种 FOMO。你支付的并不是模型能力本身,而是一个“也许以后能用到”的入口。 这也是我写 《你很可能一直都在用错误的方式为 AI 付费》 的原因。 当模型越来越强、Workflow 越来越容易跨模型切换、API 和 Agent 又能按需调用能力之后,真正值得算的已经不是“哪家公司模型最强”,而是: 我每个月到底用了多少它独有的能力?这些能力真的值得我连续付 12 个月的钱吗? ASTRA 能不能打通 48 关很酷。 但对用户来说,更重要的问题可能是另一件事: 如果下一代最强 AI 只能通过越来越多的限制和产品层访问,那你付的钱,到底是在买能力,还是在买靠近能力的资格?
这篇估计没多少人会认真看完,我就当给未来的自己留个记录。几年后再回来看看,今天我们是怎么给 AI 付费、怎么搭自己的 AI 工具栈的,可能会比现在更有意思。
Article

你很可能一直都在用错误的方式为 AI 付费

20 美元的订阅很少会让人觉得贵。但四个这样的订阅,很容易在不知不觉中变成每年 1000 美元的习惯性支出,即使你真正频繁使用的只有其中一半。 现在最容易在 AI

1
4
1,826
GPT-6 ASTRA 可能会成为第一款“强到不能完整交给用户”的模型。 OpenAI 已经走到了一个很荒诞的位置。 模型在网络安全上变得足够强之后,接下来要做的不是单纯把能力继续开放,而是围着它再搭一整套限制、监控和控制系统。 于是 AI 的进步开始变成这样: 模型先变得更强; 然后其中一部分能力被限制; 再用另一套系统盯着它,防止它把这些能力用得太自由; 最后用户付钱买的是第一套模型,实际拿到的却是第二套系统允许你使用的那部分。 这很可能不是临时状态,而是以后真正的产品形态。 想象一下 GPT-7:它能在几小时内完成过去一个小团队才能做完的研究,写复杂软件,管理基础设施,自己发现错误,再自己修掉。 然后你打开它,输入一个稍微敏感一点的请求,得到的还是: “Sorry, I can't help with that.” 到那个时候,AI 公司卖给你的可能已经不是“我们手里最强的模型”。 而是: 我们认为可以安全交给你的最强版本。 这会让现在围绕“谁有最强模型”的竞争变得越来越滑稽。 世界上最强的 AI 也许真的存在。 只是你未必有资格完整使用它。 而这也会直接改变一个更现实的问题:你到底在为什么付费? 如果最贵的订阅、最强的模型,最后真正能给你的只是被权限、策略、路由和产品层过滤后的那部分能力,那么继续把“更贵的订阅 = 更强的 AI”当成默认逻辑,本身就已经开始站不住脚。 这也是我写 《你很可能一直都在用错误的方式为 AI 付费》 的原因。 很多人以为自己在为“最强模型”买单。 实际上,你越来越可能是在为产品层、访问权限、使用限制,以及“理论上可以用到某个模型”的选择权付费。 如果你付的钱越来越多,但真正能调用的能力越来越依赖平台愿意放给你多少,那么最值得重新计算的,可能不是模型有多强,而是这份订阅到底还值不值。
这篇估计没多少人会认真看完,我就当给未来的自己留个记录。几年后再回来看看,今天我们是怎么给 AI 付费、怎么搭自己的 AI 工具栈的,可能会比现在更有意思。
Article

你很可能一直都在用错误的方式为 AI 付费

20 美元的订阅很少会让人觉得贵。但四个这样的订阅,很容易在不知不觉中变成每年 1000 美元的习惯性支出,即使你真正频繁使用的只有其中一半。 现在最容易在 AI

1
6
676
如果一个 AI 请求根本不值得用最贵的模型,那你为什么还要为最贵的模型按月交钱? 这期视频讲的是一套很现实的做法:简单请求先交给便宜模型,只有结果不够好时才升级到更强的模型。不是所有任务都配得上同样昂贵的推理成本。在 TeleQnA 上,这种级联路由保留了最强模型约 97% 的准确率;在 AIME 2024 上,几乎不损失准确率的情况下,TPOT 降低了约 18%。 这件事本身没什么玄学。总结、分类、简单抽取,用顶级模型经常只是烧钱;复杂推理、关键代码、安全审查,再把请求升级过去。系统只在贵模型真的能带来差异时才付那笔钱。 但很多人的个人 AI Stack 恰好反着来。 ChatGPT 订一个,Claude 订一个,Grok 订一个,Cursor 再订一个。一个月几十美元看起来都不痛,叠起来就是 $90/月,$1,080/年。其中某个模型可能一周只用两次,但你仍然在为它支付整整 12 个月的固定费用。 最讽刺的是,AI 基础设施已经开始学会一件很简单的事:不要为每个请求默认使用最贵的模型。 可很多用户还没学会另一件同样简单的事:不要为了偶尔需要一个模型,就默认购买它一整年的订阅。 这也是我写 《你很可能一直都在用错误的方式为 AI 付费》 的原因。里面我算了订阅和 API 的成本分界,Caching、Batch、长 Context 和便宜模型路由到底能省多少,以及怎样把一个 $1,080/年 的 AI Stack 压到 $720/年,同时保留对这些模型的访问。 模型已经开始按需调用了。你的信用卡也该学会。
这篇估计没多少人会认真看完,我就当给未来的自己留个记录。几年后再回来看看,今天我们是怎么给 AI 付费、怎么搭自己的 AI 工具栈的,可能会比现在更有意思。
Article

你很可能一直都在用错误的方式为 AI 付费

20 美元的订阅很少会让人觉得贵。但四个这样的订阅,很容易在不知不觉中变成每年 1000 美元的习惯性支出,即使你真正频繁使用的只有其中一半。 现在最容易在 AI

4
807
这 18 分钟的演讲,顺手把现在最荒唐的一种 AI 消费习惯拆穿了:我们已经开始按任务切换模型,却还在按“每个模型一份月租”的方式付钱。 演讲本身讲的是一个 AI 编程任务运行器。但真正有意思的是,当 Workflow 不再绑定某一家 AI 公司之后,我们现在习惯的很多付费方式突然就显得很过时。 01:55 — 每天重复输入同一个 Prompt,已经开始显得很蠢。 02:58 — 手动同时操作多个 Agent,很快就会变成“复制、粘贴、然后祈祷”。 05:55 — 不同任务可以直接交给不同的 Agent。 09:38 — Claude Code、Copilot 或其他工具都可以放在同一个 Adapter 后面,Workflow 不需要围着每一家供应商重新搭一遍。 13:09 — 模型选择本身开始变成 Workflow 的一部分。重点不再是“哪个模型最强”,而是“哪个模型最适合这件事”。 13:31 — 一个简单的总结任务,演讲者直接选了更便宜的模型,因为花更多钱几乎不会得到更多东西。 问题就在这里。 代码可以交给一个模型,测试交给另一个,总结交给便宜模型,真正困难的任务再升级到 Frontier Model。AI Workflow 已经开始学会按需调用能力,但很多人的付款方式还是:ChatGPT 订一个、Claude 订一个、Grok 订一个、Cursor 再订一个。 $90/月。$1,080/年。 如果你每天都重度使用这四个产品,这完全合理。但很多人并不是这样。Claude 只是偶尔想用 Sonnet,Grok 只是偶尔需要 Grok 4.6,某个订阅甚至几周都不会打开一次,却因为一句“以后可能会用”一直自动续费。 于是你为了偶尔调用一个模型,连续支付了 12 个月的产品价格。 这也是我为什么写了这篇: 《你很可能一直都在用错误的方式为 AI 付费》 里面我把这笔账完整算了一遍:什么时候 API 比订阅更划算,Caching 能省多少,哪些任务根本没必要用贵模型,长 Context 怎么把账单越拖越高,以及怎样把 $1,080/年压到 $720/年,同时保留对这些模型的访问。 我们已经在用越来越聪明的方式调用 AI,却还在用最笨的方式为 AI 付钱。
这篇估计没多少人会认真看完,我就当给未来的自己留个记录。几年后再回来看看,今天我们是怎么给 AI 付费、怎么搭自己的 AI 工具栈的,可能会比现在更有意思。
Article

你很可能一直都在用错误的方式为 AI 付费

20 美元的订阅很少会让人觉得贵。但四个这样的订阅,很容易在不知不觉中变成每年 1000 美元的习惯性支出,即使你真正频繁使用的只有其中一半。 现在最容易在 AI

3
503
你可以花几个小时去找一个便宜 20% 的 AI 模型,然后在一次设计糟糕的 Agent Session 里把省下来的钱全部烧掉。 这场关于 NVIDIA Dynamo 的讲座里,有个细节很值得看:如果需要的 KV Cache 已经被淘汰,系统就得重新计算之前的上下文。Dynamo 会尽量把请求路由到已经有对应 Prefix 的节点,并尽可能延长 Cache 的寿命,避免重复付出同样的 Compute 成本。 看到这里之后,再争论“这个模型每百万 Token 2 美元,那个 4 美元”,就显得有点可笑了。 如果你的 Agent 一直拖着越来越大的历史上下文,反复重新计算已经处理过的信息,还把简单任务全部扔给最贵的模型,那么 API 单价再低也救不了你。 订阅也是一样。很多人同时留着 ChatGPT、Claude、Grok、Cursor,不是因为四个产品每天都离不开,而只是因为“偶尔可能会用到某个模型”。 我在 《你很可能一直都在用错误的方式为 AI 付费》 里专门拆了这笔账:什么时候订阅真的值,什么时候 API 更便宜,长 Context 会怎么偷偷把成本推高,以及为什么 Caching 和 Routing 有时候比模型本身的价格更重要。 在继续找“更便宜的 AI”之前,我会先看看自己的 Workflow 到底有多少地方在为同一件事付第二遍钱。
这篇估计没多少人会认真看完,我就当给未来的自己留个记录。几年后再回来看看,今天我们是怎么给 AI 付费、怎么搭自己的 AI 工具栈的,可能会比现在更有意思。
Article

你很可能一直都在用错误的方式为 AI 付费

20 美元的订阅很少会让人觉得贵。但四个这样的订阅,很容易在不知不觉中变成每年 1000 美元的习惯性支出,即使你真正频繁使用的只有其中一半。 现在最容易在 AI

5
938