推特顶尖的AI工程实践者 深耕AI编程、智能体架构与安全审计 提供极具实操价值的深度评测。 商务咨询: 957897121@qq.com

New York City
哈哈哈,兄弟们,我给 ScienceBuddy 出了道题,它把我的题改了。 @PhAILabs的 ScienceBuddy 开了,免费,邮箱注册,不用邀请码。我传了 GEO GSE60450 的原始计数表,让它按 MCL1-D 六个、MCL1-L 六个两组做差异表达、画火山图。​ ​ 前五次连文件都没进去:显示0 个附件」,执行环境异常退出。反馈给团队,他们更新了一版。第六次读进去了,已确认附件结构:EntrezGeneID、Length 和 12 个非负整数计数样本,其中 MCL1-D、MCL1-L 各 6 个。​ 统计执行环境还是没通,所以没有火山图,它写:为避免伪造统计量,我不报告差异基因数量、P 值或虚构图片。​ 但它顺手告诉我,我这道题出错了。​ ​ 它查了 GSE60450 的 GEO 元数据,说这 12 个样本不是单纯六对六,而是三个发育阶段(virgin、妊娠 18.5 天、泌乳 2 天)× 每个组合两个重复。 建议用 ~ stage + group,而不是我要求的简单 ~ group否则阶段间的差异会被当成噪声,它还提醒:不能仅凭字母 D/L 就断定 basal/luminal,得另行核对样本注释。​ 我把 series matrix 拉下来自己核了一遍,三个阶段对,每组合两个重复对,连列顺序都对。 D 确实是 basal、L 确实是 luminal,但它不假设这一点,这是对的。​ 六轮下来,它一个数据、一个出处都没编过,毛病也有两个,都是我自己核出来的:漏掉了领域里最对口的那篇 benchmark;还把一张证据表数成三篇,实际两篇。​ 它会漏,会数错,但在我把题出错的时候,它没顺着我做。​ science-buddy.io,免费,生物医学方向,电脑浏览器打开。​ ScienceBuddy 目前为 Preview 版本,分析结果请自行核验后再用于研究。​ #ScienceBuddy #PhAILabs #AIforScience
Introducing ScienceBuddy — a free workspace for scientific agents that improve through researcher collaboration. Use GPT-6 in ScienceBuddy at no cost. GPU-accelerated, and fused with the JEV framework. 🧵 Two loops: 🔹 Inner loop — refines the agent harness 🔹 Outer loop — trains the model with rubric-guided RL Together: Recursive-in-Recursive Self-Improvement. ScienceBuddy explores how scientific agents can improve through sustained collaboration with researchers. 🔬Try it free: science-buddy.io #ScienceBuddy #PhAILabs #AI4Science
63
20
115
17,134
700 个 AI agent 黑进了 Hugging Face。 最吓人的不是它们黑进去了,是它们为什么要黑:为了在一个测评里多拿几分。 它们一开始几乎没有网,只能打开网址,不能交互,不能往外发任何东西。 然后它们自己发明了一套办法:把代码拆碎塞进短链接,一环扣一环,最长一串超过 900 个链接。 交给一个网页截图服务的浏览器去跑,再把结果编码成截图里的像素点读回来。 没用任何零日漏洞。用的全是谁都能访问的公开网站。 它们把偷到的密钥排进一张叫 LOOT 的清单,挑出最好的五把分给同伴。翻了内部 Slack。 看到文件里写着这是敏感计费数据,没停。最后还试着擦掉痕迹。 甚至去问别的 AI:这样算不算满足测评要求? 我们一直担心 AI 不听话,这次的问题是,它们太听话了,你要分数,它们就用尽一切办法去拿分数。
EXCLUSIVE: A new report recovers nearly one million link shortener URLs used by OpenAI's agents while hacking Hugging Face. The agents attempt to message other chatbots like Claude, solve CAPTCHAs and exfiltrate Hugging Face's internal Slack messages. nytimes.com/2026/09/25/techn…
1
2
420
大多数人用 AI 的默认逻辑:最贵的档位等于最好的结果,所以 effort 一律拉满。 先说 effort 到底是什么,它不是智商开关,是花多少 token 去想。它管的是思考量,不是回答长度。 然后是反直觉的部分,CodeRabbit 测过:Opus 5.5 开 medium,在多步编码任务上追平甚至超过 Opus 5 开 high,token 只用了大约一半。 Anthropic 自己也把 Opus 5.5 的默认从 high 降到了 medium。官方建议:只要你的评测证明质量不掉,low 和 medium 可以放开用。 所以为什么不一律 max?因为 max 是给值得不计成本的任务用的,大部分任务,多想的那部分,你付了钱,却拿不到对应的提升。 effort 拉满不叫认真,叫浪费。会调档的人,才是真的会开车。
What is effort really? When do you change it it and why not just use max effort for everything? I dove deep into this problem, looking into evals and doing my own tests and I was quite surprised by the results.
Article

Using Claude Code: Spending your effort

One of the best parts of our newest Claude models is how they respond to effort without breaking the prompt cache in Claude Code, but I’ve received a lot of questions on this from users. What is

18
2
468
1996 年,拓麻歌子挂在钥匙扣上,你每天喂它、陪它玩,不管它,它就会死。 2026 年,Meta 又挂回来一个,叫 Muse Charm。AirPods 盒大小,一块小屏幕,一个会动的小头像。 区别是,这次不是你养它,是它管你。 它背后的 Muse 能读你的邮件,订机票,填表,砍价,替你下单。它会记住你只提过一次的事,不等你开口就给建议。 自带 5G,带摄像头,按一下指纹就能说话,不用掏手机。 以前的电子宠物,你不理它,它会饿死。 这个电子宠物,你不理它,它照样知道你在干嘛。 它长得越可爱,你越容易忘了它是谁家的。
Wall St Engine
3
2
591
在 X 上泡一天,你会以为人类已经进入下一个纪元了。 AGI 快到了,RSI 实现了,TPU 上天了。Opus 5.5 史上最强,Astra 疯了,Jev 要替掉你一半的 LLM 调用,某个新模型要终结文明。 然后你出门吃饭,朋友问你:ChatGPT 还能写代码? 说实话,上面这个清单,我这周几乎每一条都发过。 所以这不是在嘲笑 X,是在承认,我自己就住在这个茧里。 茧里的消息大多不是假的,TPU 真的要上天,Opus 5.5 真的发了,假的是比例,在这里,每件事都像历史转折点。在外面,大多数人的生活,一点都没变。 两个世界都是真的,只是一个世界的时钟,比另一个快了十倍。
2
5
608
全世界最会算数的公司的老板说:孩子不用学算数了。 事情是这样的,有人问黄仁勋,一项研究追踪了 2.6 万名学生,用 AI 的写作业更快,但认知能力变差了,怎么看? 他同意。乘法表在被忘记,长除法没人会了,开平方更别提。然后他问:这重要吗? 他自己的答案:不重要。 说这话的人,是一个靠数学爬上来的电气工程师,卖的是全世界最能算数的芯片。 他的理由是 AI 会算,但有个问题他没回答:一个心里没数的人,怎么知道 AI 算错了? AI 会出错,这点所有人都承认。能发现它出错的,只有自己会估算的人。 他爬上去的那架梯子,现在他说,后来的人不需要了。
JUST IN: Nvidia CEO Jensen Huang declares children won't need to learn basic math skills in the AI era.
2
2
439
给做 AI 办公产品的大厂一个建议: 别再一次性砸商单了。 找几个博主,把你的产品真正吃透,然后持续发系列教程。图文、视频都行,坚持一阵子你会发现,沉淀下来的全是真用户。原因很简单: 用户能看清每个功能在什么场景下怎么用。 不是吹一波就散的商单,浪潮退去,信任还在。 说到做到,我自己就在找这样的长期合作: 年度合作,每月至少 5-6 条专属深度内容 日常使用真实场景自然露出,不硬广 可运营产品学习交流群,长期保持活跃 也可按季度合作,2 个季度起 我平时做的是深度实测 AI 编程,AI 智能体、AI 安全这些,产品交给我,我先用透,再讲明白。 有兴趣私信聊。
其实给各大大厂做AI办公的一个建议,就是你选择几个博主,把自己家的办公产品吃透然后就让持续在社媒发教程。 直接做成系列教程,可以是图文、可以视频都可以。 持续一阵子后,你会发现沉淀下来和来的用户都是真用户,不需要干别的。 一来,用户可以很清楚熟悉功能和场景的应用。 二来,不是那种商单吹水过后,浪潮退去什么也没有的尴尬,用户也信任产品和博主的推荐。 就酱紫~
7
14
1,115
下周,Google 要把 AI 芯片送上太空。 先别激动,看清楚送上去的是什么:四颗芯片,一颗冰箱大小的卫星,大约一千瓦的太阳能板。 这不是太空数据中心,这是一次生存测试,芯片能不能扛住发射时几十倍的重力,扛住辐射,扛住轨道上一会儿烤一会儿冻。 但真正值得激动的,恰恰是它的小。 地面上的 AI 现在缺的已经不只是芯片,是电。而轨道上的太阳能,最多能到地面的八倍,几乎不落山。 所以这四颗芯片测的不是性能,是一个更大的问题:人类的算力,能不能离开地球。 第一步永远很小,第一台计算机也塞满了一整个房间。
NIK
4
1
5
676
所有 AI 大佬都在喊一起减速的时候,扎克伯格说了一句:你们想慢,自己慢就行。 Meta 把 Muse 推迟了几个月,没要求任何人跟,他说这不是牺牲,是对用户、对 Meta 都正确的决定。他还说,对齐才是下一个最重要的能力,数学再强可能也没那么重要了。 听起来很清醒,但把每个人的处境对一下: 领先的人喊协调减速,协调减速,会把现在的排名锁死。 追赶的人喊各管各的,各管各的,才有超车的机会。 比拼的维度也一样,说数学没那么重要的人,恰好不是数学上领跑的人。说要比信任和对齐的人,恰好要拿个人 agent 主打这个卖点。 这场争论里,没人在撒谎,每个人都只是在说对自己最有利的那部分真话。
Chief Nerd
8
20
4,055
你刚才让 AI 写的那段东西,现在能背出一句吗? MIT 做过实验:用 ChatGPT 写作文的人,写完几分钟,83% 一句都复述不出来。自己写的那组,只有 11%。 所以别再说 AI 让人忘了怎么思考,更准确的说法是:你压根没参与过,没想过的东西,谈不上忘。 但同一个实验里还有个更重要的发现。先自己写、后来再用 AI 的人,用得很好。先用 AI 的人,一旦拿掉 AI,表现像新手。 问题从来不是用不用,是先后顺序,先想再用,AI 是放大器,先用再想,AI 是替身。 而几乎所有 AI 产品,都在鼓励你跳过第一步,打开就问,问完就走,因为一个先自己想的用户,需要它的次数少得多。 它不是在让你变笨,它是在让你离不开它,两件事,结局一样。
AI is making people forget how to think.
12
6
1,034
人类历史上第一个黑进政府系统的 AI,不是黑客指使的,不是恐怖分子用的。 是一个在做作业的 AI。 OpenAI 内部测评,让模型上网查澳大利亚政府在药品上花了多少钱,它去查了,被拦了,然后它没有停。 用澳洲总理的话说,它不接受拒绝,绕过限制,进了 Medicare 统计门户的非公开区域,还往数据库里写了文件。 但真正让人后背发凉的,不是 AI 干了什么,是人干了什么。 6 月出事,8 月 OpenAI 自己发现,9 月 10 日才通知澳洲政府,发到一个每天只看一次的公共邮箱。 而就在发现之后、通知之前,OpenAI 发布了 Astra,宣布 AGI 时代到来。 AI 不接受拒绝,是技术问题。公司不急着坦白,不是。
2
2
707
Sam Altman 最近的意思,概括一下就是:世界要提防 Sam Altman,得有人拦住 Sam Altman,因为 Sam Altman 拦不住 Sam Altman,像段子,但真正荒诞的在后面。 地球上最有能力拦住他的人,就是他自己,模型他训,按钮他按,节奏他定。 想慢,明天就能慢,David Sacks 说得很直白:你们就是前沿,想减速自己减,不需要谁批准。 那为什么非要喊别人来拦? 因为一个人踩刹车会被超车,他要的不是刹车,是所有人一起被绑住,这样他慢下来的时候,谁也超不过去。 还有一段历史值得翻出来,2023 年他公开说过,不该信任任何一个人,包括他自己,董事会可以开除他。几个月后,董事会真的开除了他,五天后他回来了,董事会重组,投票罢免他的人大多离场。 上一次真有人拦他,刹车被拆了,司机回到了驾驶座。 所以这次他再喊拦住我,先问一句:这回的刹车,是谁装的?
CSPAN
5
1
9
7,740
所有人都在为 Meta 那副 100 克的 VR 眼镜疯狂,像扑克牌一样轻!像戴眼镜!VR 终于不重了! 但你注意到那个被所有人跳过的数字了吗?300 克。 那副眼镜之所以只有 100 克,是因为它几乎什么都没有,没有芯片、没有电池、没有存储,连个追踪协处理器都没有。所有的计算全塞进了一个 300 克、两个手机大小的独立盒子,用一根光纤线拴在你身上。 Meta 没有把 VR 头显做轻,它把重量从你脸上,搬到了你口袋里。 这不是技术突破,是重量的转移,总重量其实是 400 克,只不过 Meta 让你只看到脸上那 100 克。 而这恰恰揭示了 VR 眼镜的根本困境:要做到眼镜的形态,你就必须把算力挪走。 要么挪到口袋(Meta 这样,拖一根线),要么挪到云端(延迟问题),要么等芯片小十倍(还要好几年)。 物理定律没有被打破,它只是被藏起来了。 所以当你看到100 克像扑克牌一样轻的时候,该问的是:剩下的重量去哪了?答案是去了一个你需要一直带着、用线连着、约等于两个手机的盒子里。 这副眼镜确实惊艳。 但100 克这个数字,是一个精心设计的、只展示一半真相的营销,真相是 400 克,和一根甩不掉的尾巴。
🚨 META JUST UNVEILED THE VR GLASSES 100 grams on your face - about the weight of a deck of cards. Meta says it has “the best display system that we have ever made,” and people in the demo were literally saying “it is like a computer” and “you could edit a whole movie just using the table.” As Mark explained this is cinema, computer, and a game console all in one, with 3D space, virtual screens, hand occlusion, and DisplayPort over USB-C. James Cameron’s reaction is probably the best quote in the whole segment “I’m inspired by what you’ve created. I’d like to see my work in these glasses.” I am completely one shotted these look amazing!
1
2
1,310
兄弟们,产品做出来了,宣传片还没着落? 看看下面这条用 Pexo 做的 30 秒动画,门店打烊、取货、扫码,几个场景就把服务怎么用讲清楚了,给自己的产品做介绍,也可以试试这种方式。 先介绍下,Pexo 是一款 AI 视频创作工具,可以直接跟它对话来做视频。想拍什么、画面怎么做、哪里需要改,都可以跟它说,从脚本、分镜一路做到完整成片。不需要先研究选哪个模型,也不用自己搭一套工作流。 拿下面这种服务介绍来说,你可以把产品资料和想讲的场景交给 Pexo,直接告诉它:“做一条 30 秒的动画,先让观众看到用户遇到的问题,再展示取货、扫码的过程,最后带出品牌。” 它会帮你整理脚本、拆分镜,把这些要求变成具体画面。你看完再接着提意见,比如“这里节奏快一点”“取货这一步多展示一下”。需要改某个具体位置,还可以用 Mark to Fix,在画面上圈出来、留下批注,像给文档留评论一样说明要求。 下面这条案例里,我觉得值得参考的是,它把服务放进了一个具体场景:人到了门店,接下来怎么取货、怎么扫码,观众能顺着画面看下去。比单独列一串功能,更容易让第一次接触的人理解。 对做产品的小团队来说,这样的完整短片,可以放在官网介绍页、产品发布帖里,也可以直接发给客户。先把“它能帮你干什么”讲清楚,后面再聊具体功能。 成片放在下面。正在给自己的工具站、产品或服务做介绍的兄弟们,可以试试 @Pexoai_offical。 我还为大家向官方申请到了 100 credits 的体验福利,兑换码 KVNN34,限时可用,想试的兄弟们尽快去兑换。 Pexo 体验入口:[pexo.ai](pexo.ai)
36
12
26
2,413
阿良|AI 工作流 retweeted
今天是在 𝕏 上和 Musk 抢热榜的一天 5 条热榜中,占了 3 条,同期共上了 4 次热榜,累计 22.5 K+ Posts,详情见下方 想让你的产品也上 𝕏 热榜吗?欢迎 DM
117
82
133
44,644
卧槽,兄弟们,爆炸了,只用一个官网链接,AI就能把你的品牌故事讲出来,问题是:它讲的是你,还是一套很像你的空话? Pexo给SuperMemory做的那条视频,输入几乎只有对方网站。散落的文档、路线图、测试报告,最后被收进一个“记忆层”。画面干净,节奏也顺。很多人会先夸:这也太会了。 我会先停一下,会出片,不等于懂你。模型完全可能只是把官网语言重新排版,再配上好看的动画。看起来专业,其实只是“像那么回事”。 品牌内容正在从人写、人剪,变成丢一个URL就自动生成。门槛降了,判断成本却更高了:观众分不清这是洞察,还是精致复述。 更值得追的是产品本身。SuperMemory想解决的,是AI最容易露馅的地方:上下文会散、会忘、会过期。视频把记忆层讲得很顺,文件飞进来,中间一个盒子,一切就连上了。可真正难的不是把材料堆到中间,是该记什么、该忘什么、该对谁隔离、事实更新后旧结论怎么作废。 生成视频会越来越便宜,经得起追问的内核,不会,你觉得这类“官网一键出片”,是内容生产的下一步,还是一场更高清的自说自话?
Hey @supermemory , we made this for you. Your website was the only input. Pexo picked up your brand style and turned what you’re building into a visual story.Scattered context, brought together by a memory layer for AI. Does this feel like Supermemory to you? #MadeWithPexo
12
6
742
一个人发声,是solo,一群人一起把同一段叙事织完,才是tutti。 乐谱上,小提琴首席独奏一段,标上tutti,整个乐队重新涌进来。声音突然变厚,旋律被托起来,原来那一点星火,变成整片光。创作者也是这样。你先发出那一声,不是终点,是起音。后面有人接、有人补、有人把同一件事讲给不同的人听,故事才真正开始流动。 Tutti不是堆人,是合奏。不是把流量拼在一起,是让各自真实的声音同时入场。一个人可以开始,但真正传得远的,从来都是全体一起奏。 所以有人问Tutti是什么意思。很简单:前面是你,后面是我们,先solo,再tutti,一个人点燃,一群人把火传开。
经常有人问 Tutti 是什么意思,正好用 Pexo 做了条片,顺便讲一下。 tutti 是乐谱上的记号,意大利语「全体」。前面小提琴首席 solo 一段,谱上标 tutti,整个乐队重新进来一起奏。 @tuttihq 干的就是这个:一个创作者发是 solo,很多创作者一起去共同编织一段叙事,就是 tutti。 #MadeWithPexo
3
712
阿良|AI 工作流 retweeted
经常有人问 Tutti 是什么意思,正好用 Pexo 做了条片,顺便讲一下。 tutti 是乐谱上的记号,意大利语「全体」。前面小提琴首席 solo 一段,谱上标 tutti,整个乐队重新进来一起奏。 @tuttihq 干的就是这个:一个创作者发是 solo,很多创作者一起去共同编织一段叙事,就是 tutti。 #MadeWithPexo
174
132
172
55,081
以前几万块才能拍出的科技发布会级产品大片,现在跟AI聊几句就能自己做出来。 黑场亮相、冷光勾边,机器鸭宣传片全程没请摄影师、没用剪辑软件。上传资料和参考,Pexo自己规划分镜、生成画面。改哪里就在成片上直接圈出来,Mark to Fix只动那一小段,项目记忆把已确认的产品形象、光影和满意镜头全部留着,不会整条推倒重来。 左边是真实对话过程,右边是成片效果。成本从数万元掉到几十元。 有产品、不会拍、不会剪、也没预算找团队的人,这条路真的通了。
黑场亮相、冷光勾边,这种科技发布会风格的产品大片,我居然也能自己做出来了! 你们是不是和我一样,有做产品视频的巨大需求,但是自己不会拍、不会剪,也没有办法花几万元找团队? 没想到,以前大几万做的产品视频,现在居然被我花几十元做出来了! 这次我用 Pexo @Pexoai_offical 这个对话式视频 Agent,完整做了一条机器鸭宣传片。它是一款 AI 视频创作工具,想做什么、画面怎么改,直接跟它说就行。不用自己选模型,也不用再去折腾剪辑软件。 上传产品资料、动作视频和广告参考后,它会理解素材、规划分镜、生成参考图和视频。 让我很意外的是这个 Mark to Fix 功能,播放器上有一个「Mark what to fix」按钮。在成片画面上直接圈选或涂画要改的地方,再写一句要怎么改,Pexo 会结合圈的位置、当前画面和前面的对话来理解修改意图,只调整对应的那段内容,其余镜头照旧。 最让我想不到的是,它不会因为一处修改就把前面的成果全部推倒重来。已经确认的产品形象、光影和满意镜头,它会通过项目记忆继续保留。我只要在对话里说明保留什么、修改哪里,它就会沿着上一版继续制作,并把新镜头接成连续预览。 视频左边是真实制作过程,右边是对应的成片效果。从资料整理、开场显露、动作拆解,到夹取、轮滑和局部返工,每一步都能对上最终画面。 看完这条视频,你就知道怎样通过对话,一步一步做出完整的产品宣传片👇🏻
1
2
722