图灵奖获得者、 AI 三大教父之一的 LeCun在达沃斯的发言,算是把整个硅谷的遮羞布扯了。 他说现在整个行业都被LLM彻底洗脑了,所有人都在同一条赛道上互相挖人,谁敢偏离主流谁就被骂落后。 这也是他离开Meta的真正原因,连Meta都已经LLM-pilled,他不想再跟风了。 最扎心的一句话是:纯生成式架构,不管是LLM、VLM还是VLA,永远造不出哪怕猫级的智能体。 因为它们本质上只是下一个token预测机,只能在文字和像素的空间里做统计关联,从来没有真正理解过这个世界的因果。 它们不会预测行动的后果,不会真正的规划,更没有常识。 当然,我不是说LLM没用,短期来看,scaling LLM+微调+工具调用,已经能吃掉80%的白领工作,硅谷所有人往这里冲,也算是完全理性,毕竟钱和机会就在这里。 但长期来看,这是一条有天花板的路。因为你永远不可能在文字地图上,开出一辆真正的车。 机器人、具身智能、长期自主代理、真正的科学发现,这些坎,纯LLM永远跨不过去。 LeCun说,真正的智能必须有世界模型。就是说给定当前的状态和你要做的动作,你要能准确预测下一秒世界会变成什么样。不是简单的像素级的生成,还需要对物理规律和因果关系的抽象建模。 最近Figure、特斯拉、谷歌的机器人项目,其实都在偷偷补这一课,只是没人愿意公开说,LLM不是万能地基。 我理解未来真正的智能,一定是混合栈,LLM负责语言交互和符号推理,世界模型负责因果预测和长期规划,执行层负责把计划变成动作。 LeCun从来没说过要抛弃LLM,他只是反对把LLM当成一切的答案。 硅谷现在最可怕的问题不是卷,是所有人都在同一条赛道上卷得太狠,以至于忘了终点其实根本不在这条赛道上。 世界模型这道坎,迟早要跨。 而谁先跨过去,谁就是下一个时代的赢家。 #YannLeCun #世界模型 #AGI #大模型 #具身智能
后续来了兄弟们,卧槽真的太炸了,同样的任务,同样的配置,速度比Claude Sonnet 4.6还快 6 倍,成本低约 50 倍, openrouter 和 官方 API 均限时免费 1 周使用时间,白嫖的机会,冲啊兄弟们! 我上周那条讲Elephant Alpha的推不是爆了吗,很多兄弟在评论区猜背后是谁,现在谜底揭晓了。 蚂蚁集团AGI团队(@AntLingAGI)的Ling-2.6-flash, 猜中国产大厂马甲的兄弟,你赢了。 说实话我看到架构数字那一刻,上周用它的所有体感全部对上了。 总参数104B,每次推理真正激活的只有7.4B,激活率7%,256个专家里每次只叫醒一小撮干活,其他的继续睡觉😂 这就是为啥上周我说它token消耗肉眼可见往下掉——100块钱的模型,每次推理只烧7块钱的算力,跑出了100块钱的智能,这可不是玄学啊,属于架构层面就在为效率让路。 再叠Linear Attention把传统Transformer的二次复杂度压下来,再加Multi-Token Prediction做推理加速,三件事一起上,FP8单卡341 tokens/s,Artificial Analysis实测输出215 tokens/s,和gpt-oss-120B并列第一梯队。 说实话,速度方面上周体验之后我早就服了,这回真正让我愣住的是跑分。 Artificial Analysis跑完全量评测,Ling-2.6-flash只烧了大约15M tokens,Nemotron-3-Super烧了接近10倍,Intelligence Score却拿到26,和Gemini 2.5 Flash同梯队。 都便宜到这个份上,大家下意识觉得肯定哪里凑合了,但agentic跑分直接打脸,SWE-bench Verified 62,BFCL-V4 67,TAU2-Telecom 93.86,SWE-bench测的是真实代码仓库里定位Bug加生成补丁,BFCL测的是函数调用准确性,全是硬场景,不是那种学术榜单刷分。 上周我搭那个串三个工具的小Agent跑得贼利索,现在明白了,这模型从训练阶段就是奔着Agent去的,别人做Agent是改装车,它是原厂出的Agent专用机。 所以我上周说的那套玩法现在有了官方解释——Claude管架构和规划调一次,Ling-2.6-flash管分步执行跑一百次,成本砍到十分之一,不是我瞎搭的野路子,是这个模型本来就为这个场景而生。 蚂蚁的产品线逻辑也清晰,Ling做基础,Ring做推理,Ming做多模态,这次先以stealth身份在OpenRouter和Kilo上免费放出来收集反馈,后面会开源,再推商用版LingDT,还会出BF16/FP8/INT4量化版。 路径就是社区验证→开源扩散→商业落地,对开发者来说,现在就是白嫖窗口期,免费还剩几天。 用了这段时间我给它的定位很明确,它是目前最适合一直开着的模型之一,Agent持续跑、代码补全随时触发、长文档批量处理,越高频越省钱,账单每个月都会替它说话。 但极端复杂的推理链、需要反复自我纠错的长思考任务,你可能还是得上重型推理模型,它的sweet spot是够聪明+极快+极省那个三角区,日常80%的活它接得住,接得还比大多数模型便宜。 所以说2026年看模型不能再盯着单一智能分了,当Agent从偶尔问一下变成24小时不间断跑的基础设施,每个token的有效产出就是新的胜负手,Ling-2.6-flash是目前这个方向上跑得最激进、也交出实际成绩单的选手之一。 上周说过的话,这周全部兑现,挺爽的🌚 #ElephantAlpha #Ling2Flash #AntAGI #Agent #大模型

Apr 24, 2026 · 3:23 PM UTC

45
193
904
338,837
Sort replies: Relevant Recent Liked
Replying to @AYi_AInotes
Yes, yes, yes! Been saying this for years too. World Models are what everyone in San Francisco is building robots with. And other things. Like entertainment. Great post.
1
1
3
988
哇偶,感谢Scobleizer的共鸣,您多年来一直强调世界模型在机器人和娱乐领域的核心价值,现在硅谷的实践正在印证LeCun的判断。LLM+世界模型的混合架构确实是下一阶段的关键,您觉得娱乐或具身智能哪个会先迎来爆发?期待您的观察
1
1
2
731
Replying to @AYi_AInotes
Unfortunately, that’s not exactly what is being delivered. The JEPA family of methods falls squarely into distribution‑based systems. An optimisation technique around distribution regularities, akin to a pattern cache (e.g., QKV). Valid engineering, but not a different paradigm. Same limitations as transformers derived from gradient descent. No invariants survive minimal stress: rotate or zoom, and the learned correlations break. The system remains tightly coupled to camera POV and training‑distribution specifics, not to universal concepts or even 3D. Claims of world models or a departure from the transformer paradigm dissolve under these distribution‑bound limits. Full breakdown: ai-cosmos.hashnode.dev/jepa-…
1
1
16
JEPA 不是又一个分布模型,它通过 self-supervised joint embedding 主动学习 invariant representations 和因果预测,正是为了打破 next-token 的局限。论文里已证明对旋转/缩放/新视角的泛化远超纯 Transformer。你的 breakdown 似乎把预测目标和纯 pattern matching 混为一谈了,LeCun 的世界模型路线,本质就是在补这个 gap。欢迎继续讨论原论文细节。
62
Replying to @AYi_AInotes
欣顿老爷应该也是看清了硅谷这群人才离开谷歌的,llm单一应用模式迟早走到顶,真正的智能还需要结构,单一llm+深度学习已经是屎上雕花了。
2
1
10
3,645
indeed
3,220
Replying to @AYi_AInotes
但凡真正问过llm前沿问题, 你就会明白它绝不是瞎预测下一个token. 然后也不要高估人类的"智能". 绝大多数人解数学题, 难道不就是概率性地试试各个方法奏不奏效?
1
3
1,622
确实,LLM在实际问答里已经远超纯下一个token瞎猜,很多时候表现得也很有理解,但LeCun的核心点是:当前纯生成式架构(只有统计关联)天生缺世界模型,没法可靠预测行动后果、做长期规划、拥有物理常识。 人类解题也是试错,但我们有因果直觉做底层支撑,这是LLM目前最难跨越的坎,短期LLM无敌,长期看混合架构才是方向,铁汁你觉得呢?
1
2
1,508
Replying to @AYi_AInotes
你拆解的角度很好,很干,值得静下心来学习
1
2
2,057
谢谢宝子,一起学习!
1,902
Replying to @AYi_AInotes
智能来自于意志
1
1
2,032
谢谢!
1,861
Replying to @AYi_AInotes
L'illusion que tout ces LLMs sont intelligent est tellement parfaite qu'on n'arrive même plus à savoir ce qu'est vraiment l'intelligence, Une chose est sûr, sans nous ils ne le sont pas...😅
1
1
848
Replying to @AYi_AInotes @ylecun
LeCun亲自转发👏
1
1
539
啊,又转发了吗?
1
468
Replying to @AYi_AInotes
World model 进展慢更像是 robot 物理交互数据 flywheel 还没建好,跟 architecture 假设关系不大。
1
1,713
嗯嗯,数据飞轮确实是当前最大瓶颈,但 LeCun 核心观点是:纯 next-token 架构本身就只能做统计关联,永远建不出真正的 causal world model,数据再多,也跨不过这个 paradigm limit,混合栈才是真正的解法
2
3
1,547
Replying to @AYi_AInotes @ylecun
He was out raising money…..lets see what he does with it.
1
239
貌似还没人投资😳
1
216
Replying to @AYi_AInotes
他那个模型到来之时就是人类终结之时。
1
353
yeah indeed
312
Replying to @AYi_AInotes
llm比狗🐶屎💩好一点
1
421
Replying to @AYi_AInotes @ylecun
硅谷也没说不搞世界模型啊
1
1,064
只看他们做了多少
985
Replying to @AYi_AInotes
多谢分享
1
1,128
一起学习!
1,018