带你了解全球最前沿科技、AI动态... AI 精华,讲到你懂:best.xiaohu.ai/

Mars
Claude Code 现在会在你在任务达到 5 小时限制时 继续干活,保持进行中的任务能够正常运行 它找到一个平衡点来停止在恰当的时间,而不是立刻切断停止…
Claude Code will now try to find a graceful stopping point when you hit your 5-hour limit mid-task, instead of cutting off mid-edit. It gets a small, fixed allowance pulled from your weekly limit to wrap up what it can.
12
6
7,492
Perceptron 推出全新的 Mk1.5 模型 一个专门为“具身智能”(比如无人机、机器狗、智能眼镜、智能手机等)量身定制的“超级大脑” 它能让物理设备能够真正看懂、听懂周围的世界,并自主完成任务,而且不需要针对每种设备去重新训练 Mk1.5 能够把物体当作一个连续的实体,在整个视频里“死死盯住”它,而不是像现在的普通模型逐帧截图理解... 普通多模态模型,你给它一张图片,它只能告诉你: “桌子上有一个红色杯子。” Mk1.5 可以: “红色杯子在画面左侧这个位置” “它从第 3 秒移动到了第 8 秒” “它现在被手拿起来了” “继续跟踪这个杯子” “控制无人机靠近它” “检查它后面有没有其他物体。 也就是说,它关注三个连续过程: 看见 → 理解 → 行动。 Mk1.5 加入了几个非常关键的新能力: - 原生音频理解 - 视频物体持续追踪 - Tool Calling - Web Search - Sub-agent - 更复杂的视觉推理 - 推理速度提升约 2 到 5 倍 它可以实现以下能力: 视频里的“追踪大师”: 以前的 AI 看视频往往是一张一张截图去认,但 Mk1.5 能够把物体当作一个连续的实体,在整个视频里“死死盯住”它。这个能力对于自动盘点库存、或者分析体育比赛特别有用。在视频对象分割的测试中,它拿下了四项测试中的三项第一。 懂你的“第一人称”视角: 如果你戴着智能眼镜,它能非常精准地看懂你在看什么、你的手在干嘛。官方测试显示,它在第一人称视频里定位手部动作的能力,比他们测试的最强 Gemini 模型还要高出 50%。 终于“长耳朵”了: Mk1.5 增加了原生的音频支持。它现在不仅能看字看图看视频,还能直接听声音。这让它可以实现语音转写、或者通过声音来判断周围发生了什么事件。 会自己找工具,还能“摇人”分工: 这是它非常聪明的一点。遇到不懂的问题,它会自己去调用外部工具(比如用谷歌搜网页、反向搜图等)。更厉害的是,它还能召唤“子代理(sub-agents)”,把一个复杂任务拆分出去多线并行处理,大幅提高效率。 脑子转得飞快,且依然学霸: 相比上一代 Mk1,它的反应速度快了 2 到 5 倍(比如纯聊天回复快了 4.7 倍,看图问答快了 3.3 倍)。更难得的是,在速度飙升的同时,它的视觉和视频推理能力依然保持在行业最前沿,甚至在某些测试上超越了 GPT-5 和最新的 Gemini。 开发者的福音(便宜又好用): 开发者现在就可以通过 API 接入这个模型。它支持 3.2 万(32K)Token 的上下文,而且价格非常香:每 100 万个输入 Token 只要 0.15 美元,输出也只要 1.50 美元。
Today we're releasing Mk1.5: a new intelligence layer for embodied agents. It flies drones, controls quadrupeds, powers smart glasses, tracks objects, searches the web, reasons visually, and dispatches its own sub-agents. One model, no platform-specific retraining. 🧵
5
8
6,342
卧槽 X 新的原创作者奖励第一期 发钱了 一周 2000 多美金💰 金额是之前的 4 倍 兄弟们,要信马斯克啊,跟着马斯克有肉吃🤓
76
6
153
35,652
好像是两周,说错了
1
2
4,583
又要重置了 但是我感觉大多数人本来今天就重置 比如我😑
o yes… we’re back in action and we’ll reset usage limits for all paid users across codex and ChatGPT work sorry about the brief disruption! (and yes we have a special spare codex when things are down to help us out)
34
31
23,243
每个模型出来都一顿 卧槽、牛逼 炸裂… 然后就没然后了 外行用模型做出一些牛逼、炸裂的效果后,最后还是那它们来写文档,这就是现实! 真正的高手都在默默搞别的东西!
40
3
103
32,568
卧槽,这个牛逼啊 ACTx486:把任意现成播客 变成能插话、能改剧情的视频... 平时看视频,你只能暂停、快进、拖进度条。视频里的人说了一句你没听懂的话,你没法当场追问;你想知道「这事跟我有什么关系」,视频也不会回答你。 ACTx486 想改的就是这件事 它能改造成一段「能听、能回应、还能随你改变」的视频。 你看到一半点一下屏幕,提个问题,画面里的马斯克会转过来回答你;答完了,节目接着原来的地方往下放... 完整演示。画面是一位观众 Lia 坐在沙发上用手机看这期播客,中途不断插话: 问喷火器怎么工作、让马斯克把星舰拿出来拆开讲、让他带自己去火星、叫乔别抽烟、最后让乔亲马斯克一下。
17
47
248
27,199
它保留原片的情节、节奏和语境,用户不是从零创作,而是像一个“微型导演” 你可以在视频场景里放一个 3D 物品并移动它,这个物品会跨越多轮对话一直留在那里。 还可以改变主持人的衣服,甚至把他们带到新环境里,对话结束后场景再切回录影棚。 best.xiaohu.ai/article/actx4…
2
10
3,204
沉寂许久 差点被人们遗忘的Kling 即将回归 Kling 4.0 即将发布 - 支持最长 30 秒的视频生成,可扩展至 60 秒 - 高达15 个参考元素支持 - 最高 1080p 分辨率 - 多语言声画同步,最多 3 个语音参考 - 据说还有个长视频模式:最长支持120 秒 1080p 视频,可向前和向后扩展
29
3
53
16,169
Opus 5.5给我的感觉它把我们的技能全学走了 也就是模型现在正在偷偷的吸收人类的内化经验 所以模型最近的表现更像人了、更懂你了、而且无需复杂的提示词 更夸张的他们使用技能和工具得到了突飞猛进的进步,一些第三方很火的都技能正在被模型覆盖点,比如一些视频技能!
12
1
76
17,911
现在的 LLM 训练完后权重都是完全冻结的,用户在对话中提供的最新事实、纠错或长文档 模型只能塞进 上下文窗口里,每次对话都要从头重读一遍,极度烧显存和算力,而且聊完就忘。 Boltzbit 与剑桥大学的团队研究出一种全新的方法:“把知识写进权重,而不是塞进 Prompt”... 通俗易懂理解就是: 现在的 AI(比如 ChatGPT、Claude)就像一个背完字典后被“物理封印”的学霸: 考试结束(模型训练完成)后,它的脑子(模型权重)就彻底锁死了,一个字都不能改。 你跟它聊天、给它发一份很长的资料,它怎么处理?它只能把资料写在手心里、贴在眼前(也就是 Prompt / 上下文窗口)。 致命缺点: 每说一句话,它都要把眼前厚厚的资料从头到尾重读一遍(极其浪费算力、显卡显存狂飙) 资料一旦太长,它眼前贴不下,还会看花眼(注意力稀释、答非所问) 聊完关掉对话框,它立刻忘得一干二净,下次还得重新贴一遍 他们提出不保存一堆现成的专家参数,而是用一个轻量超网络(Hypernetwork),把用户给的实时交互数据动态编译成低秩(LoRA 形式的)权重;再用一套贝叶斯机制让这套权重在对话中随着上下文动态演化。 他们官这种叫“无限参数”: 传统 MoE:在固定的比如 64 或 128 个专家库里做离散路由选择,无论怎么组合,都在一个有限的凸包内。 无限参数 LLM:它根本不存固定专家,而是根据输入数据在一个连续的潜在空间(Latent Space)里按需动态生成专属专家。因为输入的数据和隐空间是连续无限的,生成的权重也就是无边界的。 也就是别再把资料贴在眼前了,直接“临时写进脑子里”! 他们给 AI 配了一个极其轻巧的“临时脑回路生成器”。 当你把新的事实、文章或对话历史丢给它时,生成器会把这些内容直接编译成一层超轻量的临时神经元(LoRA 权重),啪的一下贴在原有的大脑上。 聊天的过程中,如果你补充了新信息或者纠正了它,它脑子里的临时回路不是重来一次,而是像滚雪球一样实时微调,越聊越懂你,但每轮对话消耗的算力却几乎不变。 通过三组核心实验验证了这种方案的实际效果,核心结论是:短文本拼不过直接读 Prompt,但在长文档、多干扰项以及多轮对话中,全面反超传统方案。 准确率:凭借贝叶斯机制,模型对用户上下文的理解像滚雪球一样持续收敛,面对指代不清的代词(如“它的作者是谁?”、“那后来呢?”),准确率随着轮数单调递增,一路爬升到接近满分。 算力成本:每一轮只做固定维度的内积更新,计算成本从第 1 轮到第 100 轮完全恒定。
We’ve just released the preview version of our latest paper: Infinite-Parameter LLMs — Generating and Adapting Weights from Live Data. In it, we demonstrate that large language models can learn up to 1,000x faster through Bayesian Self-learning transformers (BAST) than SOTA training algorithms engineered by human researchers. This breakthrough marks a critical shift in AI research, from cost-intensive, static-weight AI to energy-efficient, dynamic-weight AI. For a decade, building more advanced models has been achieved by training bigger ones on more data. This approach is now hitting a ceiling with the supply of pretraining text projected to run out in the next two to five years. Meanwhile, the fast adoption of AI agents is producing an unprecedented amount of continuously-growing data that models can learn from. None of it is captured, locked in individual sessions and lost as soon as the agent completes the task. Bringing self-learning AI agents to users captures the value of that data. We validated that BAST LLMs overcome the fundamental limitations of memory-based learning, such as Retrieval-Augmented Generation (RAG), in both cost and performance, across long-context conversations. Without underlying architectural innovation like BAST, RAG, larger context windows, and agent scaffolding suffer a drop in performance and escalating input token cost due to the static weight of LLMs. This research underscores a fundamental premise of our work at Boltzbit to achieve General Learning Intelligence and democratise model ownership. Scaling up static-weight model size or layering on more workarounds cannot address the spiraling cost of training AI systems. The viable path is a new AI architecture that adapts its own weights. Preview version of the paper: arxiv.org/pdf/2609.18842
13
24
127
39,188
薅羊毛了,兄弟们 下载或升级豆包工作电脑版或豆包电脑版,即可免费领取 30 天订阅权益 已领取过上一轮30天福利的用户,在权益即将到期期间,会获得下一轮30天的免费订阅 领取前已付费订阅的用户,付费权益自动延期,还可全程获得高峰期优先等权益。
18
3
37
22,705
这个有点牛P啊 Claude Opus 5.5 自己写代码画出一支手绘 MV: 没有使用任何 AI 生视频工具: Opus 5.5 自己通过写 p5.js 代码画出每一帧,然后在后台 Chrome 里逐帧截图,再用 ffmpeg 合成 MP4 并配上歌... 模型自己当导演:先写分镜,把歌拆成 9 章,每章一个代码文件, 再写一份简报交给并行的子 Agent,各自只改自己负责的章节...
Claude Opus 5.5 has the best visual design of any model I have tested so far
41
52
558
79,504
作者的示例只有一句话提示词; 我们在 M3 Max 上渲染 11 秒示例用了 47 秒;文中另给了先出分镜、再写代码的两步提示词和整首 MV 的提示词。 作者开源了具体模板:github.com/JohnHeibel/PDoomV… 我整理了详细制作方法: best.xiaohu.ai/article/opus-…
1
6
30
5,065
据The Information:Google 即将发布旗舰Gemini 4 AI模型。 就在这两天😎
40
1
128
50,538
Claude 的云端会话正式发布 即使您的笔记本电脑已关闭,也能让 Claude Code 持续运行... 云端会话运行在 Anthropic 托管的云端设施上, 你可以在 claude.ai/code 启动一个对话,或者从 Claude APP中的Code选项卡启动,也可以在 CLI 中使用 claude --cloud 它就能在云端运行 Claude Code
7
4
13
8,297
云端用量和本地分开计算,不会占用本地的用量 现有订阅用户可领取一次性云端额度: Pro 为 100 美元 Max 为 250 美元 本地用量达到限额时,也可以继续用云端额度 通过下面链接或命令行的 /claim-credit 领取,截止日期为 10 月 7 日 claude.ai/code/claim-credit/…
2
5
3,022
我已领取成功
1
1,788
牛P了 OpenAI 将 ChatGPT Voice 升级为语音 Agent 语音不光能回答问题,现在能直接帮你把事办了👇 你可以直接通过语音和GPT交流,它能帮你直接干活 ▎ · 在日历里找空档,安排行程 ▎ · 查出重复扣费,取消后发邮件要退款 ▎ · 一句话做出网站,再加个结账页 ▎ · 发邮件租船,对方回复后直接订下 ▎ · 查天气、查预约、逛网站买东西 一边做饭一边吩咐,手不用碰手机...
24
4
57
13,597