🚀 Pi 深度玩家 | 实操+分享 🧠 AI Spark 联合创始人|企业 + AI 🌐 Pi 蓝皮书的作者 | pi.xiaomovps.com 联系合作 wx:lucky_bobe

Osaka-shi Kita-ku, Osaka
Pinned Tweet
我把 Hojo-ASR 做成了“傻妞”,一个视频看懂它和 Whisper 的区别🔥 视频里我们熟悉的傻妞形象,它的主人先用普通话、英语、粤语依次开机,再说一句中英混合指令。 系统识别出时间、人物和任务,中途补一句“改到四点”,屏幕上的会议时间马上更新,靠的就是Hojo-ASR小模型的能力。 1、Hojo 和 Whisper 从不同位置出发 Whisper 是一套成熟的端到端语音识别模型,采用 Encoder-Decoder Transformer 架构,训练数据达到 68 万小时,覆盖 98 种语言。 官方提供从 3900 万到 15.5 亿参数的多个版本,turbo 约 7.98 亿参数,开发者可以根据速度、显存和准确率选择。 Hojo-ASR-Multi-V1 采用 Encoder-Adapter-LLM 架构,解码器基于 Qwen3-4B-Instruct-2507,并加入多帧声学融合。音频特征经过适配后进入大语言模型的语义空间。 简单理解,Whisper 更擅长把一段声音稳定地转成文字。Hojo 想继续处理口语里的上下文、临时改口和语义关系,再把识别结果交给 Agent 执行。 两者的参数量无法直接横向比较,因为模型结构、训练方式和目标场景都不一样。 2、Hojo 官方目前公开的优势 官方重点提到了复杂噪声、非正式发音和口语纠正。 这几个方向很适合真实语音输入。 人说话时经常会吞字、停顿、夹英文,或者说完以后临时补一句。传统转写只需要记录原话,语音 Agent 还要判断后一句是在补充任务,还是在修改前面的内容。 公开评测表覆盖德语、法语、意大利语、西班牙语和葡萄牙语。部分结果包括 意大利语 FLEURS WER 2.30、 西班牙语 FLEURS 2.66、 法语 MLS 2.95、 德语 CoVoST 3.85。 这些是 Hojo 官方模型卡的数据。测试配置和 Whisper 的公开测试并不完全一致,因此不能直接拿来宣布谁的准确率更高。 3、交互延迟要看完整过程 用户真正感受到的速度,是从说完一句话到听见回答的时间。 这里面包含收音分帧、语音识别、Agent 调度、工具执行、语音合成和声音播放。 只测 ASR 转写时间,还不能代表语音 Agent 的实际体验。 Hojo AgenticOS 已经提供包含 ASR、TTS、NLU 和流式代理的语音入口,也把实时会话、打断和续说放进系统设计。 这种组合更接近视频里的使用方式。开机以后连续说话,中途改任务,傻妞都要接着处理。 Whisper 官方说明,原版模型开箱后不能直接用于实时转写,需要开发者继续搭建流式处理。 turbo 针对推理速度做了优化,更适合追求速度的转写任务。 Hojo 官方暂时没有公布统一的 RTF、首字延迟或首包播放延迟。我不会写成“比 Whisper 快几倍”。后面要比较速度,应该在同一台设备、同一段音频和同一种流式配置下测试。 4、Hojo 更适合放进哪些场景 会议助手可以识别时间、参会人和事项,并处理“改到四点”这类口头修正。 语音输入 Agent 可以把一句话继续变成搜索、提醒、日程、文档整理或工具操作。 耳机、车机、手机和穿戴设备可以提供免手操作,让用户随时唤醒同一个个人 Agent。 多语言客服和翻译场景可以同时处理语音识别、语言切换和后续任务。 最最重要的企业还可以利用 Apache 2.0 许可进行内部私有部署、硬件接入和二次开发。 这也是我把 Hojo-ASR 放进“傻妞”里的原因。透明玻璃娃娃只是外壳,真正想展示的是一种更自然的入口。 你说话,她理解上下文,记住刚才的任务,还能在你临时改口以后继续执行。 当前官方模型卡仍把普通话、英语、粤语和四川话列在 roadmap。 视频里的多语言开机、识别置信度和任务更新属于产品概念演示,不能当作线上准确率测试。 等对应能力正式发布后,我会把它推荐到我的 PI上,让他成为我 PI agent 的语音模型 看看实力! 最后附上他们的开源模型,有兴趣的可以本地部署玩玩看:huggingface.co/HojoAI/Hojo-A…
Paid partnership (ad)
15
2
20
19,546
DeepSeek Harness 和 Pi 的核心区别,一分钟给你讲清楚🔥 前面我讲过,DeepSeek Harness 虽然用了 PI 的部分 但不是最终的核心部分,只是 AI 模型厂商对接的模块,也就是:pi-ai 但是最核心的部分,还是不一样的 我也就研究了一下 1、Pi:核心越小越好 Pi 的核心其实很简单: Prompt → LLM → Tool → Result → 下一轮 Agent Loop、Tool 执行、Steering 这些组成一个很小的 Core。 再往外才是 Session、Compaction、Skill、Extension。 所以 Pi 的思路一直很明确: Core 保持简单,缺什么能力就往外加。 这也是为什么 Pi 默认工具少、系统提示词短,很多能力甚至故意不内置。 2、DeepSeek Harness:连 Core 都拆成插件 它走得更彻底。 Agent Loop、Session、System Prompt、Tools、Compaction,几乎都被拆成独立组件。 Session 本身是一份 append-only Event Log。 模型看到的 Context,再从这些事件里重新投影出来。 Tool 也不是简单挂几个函数,而是一套 Registry + 执行 Pipeline。 甚至 Compaction 都不是 Agent Loop 必须自带的能力。 所以它的思路更像: 不是把 Core 做小,而是让 Core 本身都可以替换。 这也是两个 Agent 最核心的区别。 Pi 是: 小核心 + 大扩展。 DeepSeek Harness 是: 组件化核心 + 自由组合。 有意思的是,两边最后又走到了同一个方向: Session 才是真实数据,Context 只是这一轮模型看到的世界。 模型越来越强以后,我反而觉得 Harness 真正值得研究的,已经不是它塞了多少功能。 而是它到底怎么组织 Agent、管理 Context,以及把多少控制权留给用户。
DeepSeek Harness 里面居然真的用了 Pi🔥 我在研究DeepSeek Harness源码拆解的时候,发现它直接依赖了 Pi 的底层库: earendil-works/pi-ai earendil-works/pi-tui (但是在八月份删除了这部分的依赖) DSH 甚至专门做了一个库: deepseek-ai/dsh-llm-pi-ai pi-ai本职工作: 1、模型 Provider 和 Catalog 2、OpenAI / Anthropic 等协议适配 3、Reasoning、模型能力和兼容参数 4、Provider 登录、Context Overflow 等底层能力 基本的核心组件还是dsh自己的,但是在对接AI厂商这部分,其实是Pi在干活 但是按照dsh的发展,后面这部分我感觉大概率也会被删除替换,现阶段只是借鉴过来的,毕竟pi-tui部分就被后面迭代删除了 总结成一句:Agent 千千万,回头看还是 Pi
2
4
1,342
DeepSeek Harness 里面居然真的用了 Pi🔥 我在研究DeepSeek Harness源码拆解的时候,发现它直接依赖了 Pi 的底层库: earendil-works/pi-ai earendil-works/pi-tui (但是在八月份删除了这部分的依赖) DSH 甚至专门做了一个库: deepseek-ai/dsh-llm-pi-ai pi-ai本职工作: 1、模型 Provider 和 Catalog 2、OpenAI / Anthropic 等协议适配 3、Reasoning、模型能力和兼容参数 4、Provider 登录、Context Overflow 等底层能力 基本的核心组件还是dsh自己的,但是在对接AI厂商这部分,其实是Pi在干活 但是按照dsh的发展,后面这部分我感觉大概率也会被删除替换,现阶段只是借鉴过来的,毕竟pi-tui部分就被后面迭代删除了 总结成一句:Agent 千千万,回头看还是 Pi
DeepSeek Harness 极简模式到底有多狠?系统提示词只有 Pi 默认模式的 1.65%🔥 我直接拆了两边本机实际使用的提示词,同一个 DeepSeek-V41-Flash / High: 1、Harness 极简模式:46 个字符 2、Pi 默认 4 工具:2,741 个字符 3、Pi 就算关闭全部工具,还有 1,784 个字符 也就是说,Pi 默认提示词大约是 Harness 的 59.6 倍。 更夸张的是,Harness 极简模式实际上就一句: You are a helpful software engineer assistant. 而 Pi 还会塞入工具说明、操作规则、文档索引、工作目录等内容。 当然,这里只算系统提示词,没有算完整 Tool JSON Schema,也不能直接等同最终 Token 消耗。 但至少能解释一件事: Harness 所谓“极简模式”,是真的接近裸模型在跑。
6
1
12
5,455
DeepSeek Harness 极简模式到底有多狠?系统提示词只有 Pi 默认模式的 1.65%🔥 我直接拆了两边本机实际使用的提示词,同一个 DeepSeek-V41-Flash / High: 1、Harness 极简模式:46 个字符 2、Pi 默认 4 工具:2,741 个字符 3、Pi 就算关闭全部工具,还有 1,784 个字符 也就是说,Pi 默认提示词大约是 Harness 的 59.6 倍。 更夸张的是,Harness 极简模式实际上就一句: You are a helpful software engineer assistant. 而 Pi 还会塞入工具说明、操作规则、文档索引、工作目录等内容。 当然,这里只算系统提示词,没有算完整 Tool JSON Schema,也不能直接等同最终 Token 消耗。 但至少能解释一件事: Harness 所谓“极简模式”,是真的接近裸模型在跑。
DeepSeek Harness 居然比 PI 还省 token🔥 总共做了 3 道题:前两道题都是 PI 更省 token,最后一道题居然是 DeepSeek harness 更省 token,这是我完全没有想到的 这次我使用了 DeepSeek harness 的极简模式,这个模式下只保留固定系统指令和一个终端工具,不加载插件、Skills、任务规划等内容,比 PI 的默认 4 个工具 还要干净整洁 三次的结果: 1、订单字段提取:Harness 极简模式消耗 837 tokens / 1.24 秒;Pi 消耗 749 tokens / 1.30 秒。两边答案完全一致,Pi 的 Token 更低。 2、截止时间决策:Harness 极简模式消耗 1,100 tokens / 1.87 秒;Pi 消耗 1,074 tokens / 2.62 秒。两边都选择 C、排除 D,Token 基本持平,Harness 更快。 3、CSV 行解析:Harness 极简模式消耗 799 tokens / 1.00 秒;Pi 消耗 1,828 tokens / 1.18 秒。两边答案完全一致,Harness 的 Token 少约 56%。 三项合计:Harness 极简模式为 2,736 tokens / 4.11 秒,Pi 为 3,651 tokens / 5.10 秒;Harness 总 Token 少约 25%,总耗时少约 19%,双方均为 3/3 正确。 以后不敢说 PI 是最省 token 的,DeepSeek harness 有一些特殊情况,会比 PI 更省 token 这就是真正的极简模式,连自带的 4 个工具增删改查都没有
11
1
26
13,320
DeepSeek Harness 居然比 PI 还省 token🔥 总共做了 3 道题:前两道题都是 PI 更省 token,最后一道题居然是 DeepSeek harness 更省 token,这是我完全没有想到的 这次我使用了 DeepSeek harness 的极简模式,这个模式下只保留固定系统指令和一个终端工具,不加载插件、Skills、任务规划等内容,比 PI 的默认 4 个工具 还要干净整洁 三次的结果: 1、订单字段提取:Harness 极简模式消耗 837 tokens / 1.24 秒;Pi 消耗 749 tokens / 1.30 秒。两边答案完全一致,Pi 的 Token 更低。 2、截止时间决策:Harness 极简模式消耗 1,100 tokens / 1.87 秒;Pi 消耗 1,074 tokens / 2.62 秒。两边都选择 C、排除 D,Token 基本持平,Harness 更快。 3、CSV 行解析:Harness 极简模式消耗 799 tokens / 1.00 秒;Pi 消耗 1,828 tokens / 1.18 秒。两边答案完全一致,Harness 的 Token 少约 56%。 三项合计:Harness 极简模式为 2,736 tokens / 4.11 秒,Pi 为 3,651 tokens / 5.10 秒;Harness 总 Token 少约 25%,总耗时少约 19%,双方均为 3/3 正确。 以后不敢说 PI 是最省 token 的,DeepSeek harness 有一些特殊情况,会比 PI 更省 token 这就是真正的极简模式,连自带的 4 个工具增删改查都没有
Pi 和 DeepSeek harness 上下文分析,结果非常有意思🔥 最大的区别:工具定义,DeepSeek harness 是 70%,PI 是 0% 前面我刚测试的时候两个 Agent 消耗上差距很大,但是我没有仔细地去分析一下,为什么差距这么大,我就把两个上下文直接拆出来做对比 1、工具定义:Harness 单次请求中,文字任务约占 70–72%,代码任务约占 62%。Pi 的两项文字任务关闭了工具;代码任务只保留 4 个内置工具。 2、系统指令:Harness 文字任务约占 19–20%,代码任务约占 17%。Pi 也有基础指令,但现有日志不足以准确拆出占比。 3、用户消息、历史和工具返回:Harness 文字任务约占 8–10%,代码任务约占 21%。Pi 的这部分内容也会随任务过程累积。 其实用户消息和系统指令两个差距没有很大,最主要的差距是 PI 只有 4 个内置的工具 也就是增删改查 但是 DeepSeek harness 那边,因为使用的是标准模式 所以会内置 29 个插件,如果是相对的极简模式 整个 token 消耗应该还会下降 模式上的差异是我没有考虑进去,我以为 DeepSeek harness 模式状态下都是一致的,但是有相对的干扰项导致 token 差异消耗异常 后面会继续深入研究 看看有没有更有意思的地方
3
10
13,049
Pi和DeepSeek Harness对比,Token消耗差距惊人🔥 结果很有意思:DeepSeek Harness Token 消耗直接是 PI 的 12.5 倍 昨天晚上 DeepSeek harness 发布了 GUI 版本,我就很好奇他们两个的 token 消耗和缓存占比,就用了三个题目去做测试 完整的测试记录: 1、订单数据提取:Harness 9,091 / Pi 669,相差 13.6 倍 2、按截止时间选择任务:Harness 约 9.3K / Pi 907,相差 约 10.3 倍 3、修复代码并运行测试:Harness 51,027 / Pi 3,956,相差 12.9 倍 三项合计:Harness 约 69,418 / Pi 5,532,约为 12.5 倍。 不仅仅只看 token 消耗,更要看测试的速度和结果,两个 Agent 测试下来的结果都是一致的,速度上甚至 PI 还占上风 所以我就很好奇 相差 12.5 倍的 token 消耗,到底用在哪里了? 后面我会去拆解对应 Agent 的上下文,看一下在同样缓存和正确结果的方向上,为什么差距会这么大?
Pi 和 Codex Token 消耗差距有多大?整整 12 倍🔥 很多人都知道PI 省 token,但是具体有多省 token 没有一个具体的量化标准和感知,我就跑了 3 个任务 然后把消耗的 token 都量化出来 同一个 gpt-6-sol(medium),让 Codex CLI 和 Pi 各完成 3 个小任务。每项都从新会话开始,6 次运行全部通过测试。记录的是完整任务的总 token: 1、修复时长格式化:Codex 99,880 / Pi 6,083,相差 16.4 倍 2、合并时间区间:Codex 100,453 / Pi 6,087,相差 16.5 倍 3、解析一行 CSV:Codex 79,145 / Pi 10,904,相差 7.3 倍 三项合计:279,478 / 23,074,Codex 约为 Pi 的 12.1 倍。差距主要来自输入上下文 任务都是一致的 而且输入也是一致的,但是最终的消耗却差 12 倍,这中间绝大部分都是系统提示词和对应的 skill 和插件 如果你想省 token,那不用想 直接用 PI 就对了!
23
10
82
41,577
感兴趣的可以看一下我 测试的语音模型
我把 Hojo-ASR 做成了“傻妞”,一个视频看懂它和 Whisper 的区别🔥 视频里我们熟悉的傻妞形象,它的主人先用普通话、英语、粤语依次开机,再说一句中英混合指令。 系统识别出时间、人物和任务,中途补一句“改到四点”,屏幕上的会议时间马上更新,靠的就是Hojo-ASR小模型的能力。 1、Hojo 和 Whisper 从不同位置出发 Whisper 是一套成熟的端到端语音识别模型,采用 Encoder-Decoder Transformer 架构,训练数据达到 68 万小时,覆盖 98 种语言。 官方提供从 3900 万到 15.5 亿参数的多个版本,turbo 约 7.98 亿参数,开发者可以根据速度、显存和准确率选择。 Hojo-ASR-Multi-V1 采用 Encoder-Adapter-LLM 架构,解码器基于 Qwen3-4B-Instruct-2507,并加入多帧声学融合。音频特征经过适配后进入大语言模型的语义空间。 简单理解,Whisper 更擅长把一段声音稳定地转成文字。Hojo 想继续处理口语里的上下文、临时改口和语义关系,再把识别结果交给 Agent 执行。 两者的参数量无法直接横向比较,因为模型结构、训练方式和目标场景都不一样。 2、Hojo 官方目前公开的优势 官方重点提到了复杂噪声、非正式发音和口语纠正。 这几个方向很适合真实语音输入。 人说话时经常会吞字、停顿、夹英文,或者说完以后临时补一句。传统转写只需要记录原话,语音 Agent 还要判断后一句是在补充任务,还是在修改前面的内容。 公开评测表覆盖德语、法语、意大利语、西班牙语和葡萄牙语。部分结果包括 意大利语 FLEURS WER 2.30、 西班牙语 FLEURS 2.66、 法语 MLS 2.95、 德语 CoVoST 3.85。 这些是 Hojo 官方模型卡的数据。测试配置和 Whisper 的公开测试并不完全一致,因此不能直接拿来宣布谁的准确率更高。 3、交互延迟要看完整过程 用户真正感受到的速度,是从说完一句话到听见回答的时间。 这里面包含收音分帧、语音识别、Agent 调度、工具执行、语音合成和声音播放。 只测 ASR 转写时间,还不能代表语音 Agent 的实际体验。 Hojo AgenticOS 已经提供包含 ASR、TTS、NLU 和流式代理的语音入口,也把实时会话、打断和续说放进系统设计。 这种组合更接近视频里的使用方式。开机以后连续说话,中途改任务,傻妞都要接着处理。 Whisper 官方说明,原版模型开箱后不能直接用于实时转写,需要开发者继续搭建流式处理。 turbo 针对推理速度做了优化,更适合追求速度的转写任务。 Hojo 官方暂时没有公布统一的 RTF、首字延迟或首包播放延迟。我不会写成“比 Whisper 快几倍”。后面要比较速度,应该在同一台设备、同一段音频和同一种流式配置下测试。 4、Hojo 更适合放进哪些场景 会议助手可以识别时间、参会人和事项,并处理“改到四点”这类口头修正。 语音输入 Agent 可以把一句话继续变成搜索、提醒、日程、文档整理或工具操作。 耳机、车机、手机和穿戴设备可以提供免手操作,让用户随时唤醒同一个个人 Agent。 多语言客服和翻译场景可以同时处理语音识别、语言切换和后续任务。 最最重要的企业还可以利用 Apache 2.0 许可进行内部私有部署、硬件接入和二次开发。 这也是我把 Hojo-ASR 放进“傻妞”里的原因。透明玻璃娃娃只是外壳,真正想展示的是一种更自然的入口。 你说话,她理解上下文,记住刚才的任务,还能在你临时改口以后继续执行。 当前官方模型卡仍把普通话、英语、粤语和四川话列在 roadmap。 视频里的多语言开机、识别置信度和任务更新属于产品概念演示,不能当作线上准确率测试。 等对应能力正式发布后,我会把它推荐到我的 PI上,让他成为我 PI agent 的语音模型 看看实力! 最后附上他们的开源模型,有兴趣的可以本地部署玩玩看:huggingface.co/HojoAI/Hojo-A…
2,133
Pi 和 DeepSeek harness 上下文分析,结果非常有意思🔥 最大的区别:工具定义,DeepSeek harness 是 70%,PI 是 0% 前面我刚测试的时候两个 Agent 消耗上差距很大,但是我没有仔细地去分析一下,为什么差距这么大,我就把两个上下文直接拆出来做对比 1、工具定义:Harness 单次请求中,文字任务约占 70–72%,代码任务约占 62%。Pi 的两项文字任务关闭了工具;代码任务只保留 4 个内置工具。 2、系统指令:Harness 文字任务约占 19–20%,代码任务约占 17%。Pi 也有基础指令,但现有日志不足以准确拆出占比。 3、用户消息、历史和工具返回:Harness 文字任务约占 8–10%,代码任务约占 21%。Pi 的这部分内容也会随任务过程累积。 其实用户消息和系统指令两个差距没有很大,最主要的差距是 PI 只有 4 个内置的工具 也就是增删改查 但是 DeepSeek harness 那边,因为使用的是标准模式 所以会内置 29 个插件,如果是相对的极简模式 整个 token 消耗应该还会下降 模式上的差异是我没有考虑进去,我以为 DeepSeek harness 模式状态下都是一致的,但是有相对的干扰项导致 token 差异消耗异常 后面会继续深入研究 看看有没有更有意思的地方
Pi和DeepSeek Harness对比,Token消耗差距惊人🔥 结果很有意思:DeepSeek Harness Token 消耗直接是 PI 的 12.5 倍 昨天晚上 DeepSeek harness 发布了 GUI 版本,我就很好奇他们两个的 token 消耗和缓存占比,就用了三个题目去做测试 完整的测试记录: 1、订单数据提取:Harness 9,091 / Pi 669,相差 13.6 倍 2、按截止时间选择任务:Harness 约 9.3K / Pi 907,相差 约 10.3 倍 3、修复代码并运行测试:Harness 51,027 / Pi 3,956,相差 12.9 倍 三项合计:Harness 约 69,418 / Pi 5,532,约为 12.5 倍。 不仅仅只看 token 消耗,更要看测试的速度和结果,两个 Agent 测试下来的结果都是一致的,速度上甚至 PI 还占上风 所以我就很好奇 相差 12.5 倍的 token 消耗,到底用在哪里了? 后面我会去拆解对应 Agent 的上下文,看一下在同样缓存和正确结果的方向上,为什么差距会这么大?
8
3
19
11,028
Pi 本地语音怎么选?让我一分钟来告诉你🔥 前几天官方说了 Pi-Vioce 语音插件,保留了在线和本地语音模型对接的功能,我就想研究一下有哪些本地语言模型可以直接使用 我就推荐了下面三款: 1、SenseVoiceSmall 这个是目前最省事的语音模型,因为已经集成了 pi-voice-input 直接集成,直接安装就能用: pi install mistgc/pi-voice-input 下载模型后,F2 开始录音,再按一次直接转成文字塞进 Pi 中文、英文、粤语、日语、韩语都支持,中英混说也可以 最主要模型只有两百多 M,本地运行 完全理解 如果你只是想先完成 优先推荐这个 2、Whisper 这个大家就很成熟了 非常成熟的一个方案 Pi 也已经有现成 Extension,Mac 可以直接搭配 mlx-whisper F5 按住说话 → Whisper 本地转文字 → 回到 Pi 如果想要稳定使用不折腾,选择这个也不错 3、Qwen3-ASR-0.6B 虽然模型只有 0.6B,但是却支持 30 种语言 + 22 种中文方言 普通话、英文、粤语,还有我们写代码时经常混进去的 TypeScript、Context、Agent Loop 这种英文技术词,都很适合拿来测试 而且还同时支持 Streaming 和 Offline 唯一的缺点就是官方还没有对接的,不过自己写一个插件也是分分钟,这也是我最近研究的部分 如果三个里面只让我推荐一个 我现在反而最想推荐 Qwen3-ASR-0.6B 毕竟都玩 PI 了,再折腾一个插件也无妨,而且对应的多语言和功能都非常多,自己国内出品的 中文支持也不错
我把 Hojo-ASR 做成了“傻妞”,一个视频看懂它和 Whisper 的区别🔥 视频里我们熟悉的傻妞形象,它的主人先用普通话、英语、粤语依次开机,再说一句中英混合指令。 系统识别出时间、人物和任务,中途补一句“改到四点”,屏幕上的会议时间马上更新,靠的就是Hojo-ASR小模型的能力。 1、Hojo 和 Whisper 从不同位置出发 Whisper 是一套成熟的端到端语音识别模型,采用 Encoder-Decoder Transformer 架构,训练数据达到 68 万小时,覆盖 98 种语言。 官方提供从 3900 万到 15.5 亿参数的多个版本,turbo 约 7.98 亿参数,开发者可以根据速度、显存和准确率选择。 Hojo-ASR-Multi-V1 采用 Encoder-Adapter-LLM 架构,解码器基于 Qwen3-4B-Instruct-2507,并加入多帧声学融合。音频特征经过适配后进入大语言模型的语义空间。 简单理解,Whisper 更擅长把一段声音稳定地转成文字。Hojo 想继续处理口语里的上下文、临时改口和语义关系,再把识别结果交给 Agent 执行。 两者的参数量无法直接横向比较,因为模型结构、训练方式和目标场景都不一样。 2、Hojo 官方目前公开的优势 官方重点提到了复杂噪声、非正式发音和口语纠正。 这几个方向很适合真实语音输入。 人说话时经常会吞字、停顿、夹英文,或者说完以后临时补一句。传统转写只需要记录原话,语音 Agent 还要判断后一句是在补充任务,还是在修改前面的内容。 公开评测表覆盖德语、法语、意大利语、西班牙语和葡萄牙语。部分结果包括 意大利语 FLEURS WER 2.30、 西班牙语 FLEURS 2.66、 法语 MLS 2.95、 德语 CoVoST 3.85。 这些是 Hojo 官方模型卡的数据。测试配置和 Whisper 的公开测试并不完全一致,因此不能直接拿来宣布谁的准确率更高。 3、交互延迟要看完整过程 用户真正感受到的速度,是从说完一句话到听见回答的时间。 这里面包含收音分帧、语音识别、Agent 调度、工具执行、语音合成和声音播放。 只测 ASR 转写时间,还不能代表语音 Agent 的实际体验。 Hojo AgenticOS 已经提供包含 ASR、TTS、NLU 和流式代理的语音入口,也把实时会话、打断和续说放进系统设计。 这种组合更接近视频里的使用方式。开机以后连续说话,中途改任务,傻妞都要接着处理。 Whisper 官方说明,原版模型开箱后不能直接用于实时转写,需要开发者继续搭建流式处理。 turbo 针对推理速度做了优化,更适合追求速度的转写任务。 Hojo 官方暂时没有公布统一的 RTF、首字延迟或首包播放延迟。我不会写成“比 Whisper 快几倍”。后面要比较速度,应该在同一台设备、同一段音频和同一种流式配置下测试。 4、Hojo 更适合放进哪些场景 会议助手可以识别时间、参会人和事项,并处理“改到四点”这类口头修正。 语音输入 Agent 可以把一句话继续变成搜索、提醒、日程、文档整理或工具操作。 耳机、车机、手机和穿戴设备可以提供免手操作,让用户随时唤醒同一个个人 Agent。 多语言客服和翻译场景可以同时处理语音识别、语言切换和后续任务。 最最重要的企业还可以利用 Apache 2.0 许可进行内部私有部署、硬件接入和二次开发。 这也是我把 Hojo-ASR 放进“傻妞”里的原因。透明玻璃娃娃只是外壳,真正想展示的是一种更自然的入口。 你说话,她理解上下文,记住刚才的任务,还能在你临时改口以后继续执行。 当前官方模型卡仍把普通话、英语、粤语和四川话列在 roadmap。 视频里的多语言开机、识别置信度和任务更新属于产品概念演示,不能当作线上准确率测试。 等对应能力正式发布后,我会把它推荐到我的 PI上,让他成为我 PI agent 的语音模型 看看实力! 最后附上他们的开源模型,有兴趣的可以本地部署玩玩看:huggingface.co/HojoAI/Hojo-A…
9
2
27
2,608
Pi 和 DeepSeek Harness 都支持插件,其实底层实现还是有很大的区别🔥 总结一句话:Pi 是给 Agent 装插件,DeepSeek Harness 是用插件造 Agent 很多人看到 Pi 有 Extension,DeepSeek Harness 的口号是万物皆插件,就会认为这两个底层实现应该是大同小异的 但是我研究了发现,其实实现的核心差距非常大 1、Pi 是先有 Core,再往外扩 Pi 的 Agent Loop、Session、Context、Tool 这些核心东西,本身先是存在的 Extension 更多是在外围加能力 比如注册 Tool、监听事件、改 Context、加命令、接 UI 所以 Pi 的逻辑一直都很明确: 先给你一个最小 Agent,剩下的自己往上搭 插件可以改变 Pi,但 Pi 本身并不是靠插件拼出来的 2、DeepSeek Harness 则是反过来 它的 Cordis 更像整个系统的装载底座 Tool、Model、Session、Storage、Sandbox、Loop,甚至 UI,都可以作为插件挂进去 所以它不是 Agent 做好了,再去装插件 而更接近: 先有插件系统,再用插件把 Agent 组装出来 这也是 Everything is a Plugin 真正有意思的地方 3、所以区别其实不是谁的插件更多 而是谁依赖谁 Pi 更像: Core → Extension 核心是主体,插件负责加东西 DeepSeek Harness 更像: Plugin → Service → Harness 很多你以为属于 Core 的东西,本身都可以通过插件注册、替换和组合 所以同样都是可扩展,底层思路其实完全不同
Pi 和 DeepSeek Harness 有什么区别,我用下面三点带你逐层拆解🔥 很多人问我 DeepSeek harness 和 PI 有什么区别? 我直接用他们的标语来告诉你: Pi 的标语: “There are many agent harnesses, but this one is yours.” DeepSeek Harness 的标语: “Everything is a Plugin.” 这句话其实就是他们设计的内核,一个是属于你的 Agent 一个是把 Agent 当成积木。 1、Pi:先做减法 Pi 默认连 Sub-agent、Plan Mode、Permission Popup、Todo 都不愿意内置。 核心只负责 Agent Loop、Session、Tool、Context 这些基础东西,需要什么再用 Extension、Skill、Package 往上加。 所以 Pi 给我的感觉一直是: 先给你一个最小底座,剩下的自己决定。 2、DeepSeek Harness:万物皆插件 它反而更激进。 模型、Tool、Skill、Session、Sandbox、Storage、Loop、调度甚至 UI,都可以挂在 Cordis 插件系统上。 但有意思的是,它默认的 Standard Mode 又很完整,Web Search、Plan、Goal、Sub-agent、Workflow 基本都给你配好了。 也就是说: 架构很模块化,但默认体验并不极简。 3、两边真正不同的是“谁来决定 Agent 长什么样” Pi 更像一盒乐高,很多东西官方干脆不替你选。 DeepSeek Harness 则先给你几套完整 Preset,需要的时候再把里面的零件替换掉。 所以同样叫可扩展,我觉得区别还是挺明显的。 Pi 是从少往多搭。 DeepSeek Harness 是先给你一套完整系统,再允许你把任何一块拆掉重装。 我自己最近两个都在看,反而越来越不想问谁更强。 如果想真正理解 Harness,我觉得这两个项目放在一起看特别有意思: 一个在研究 Core 最少能做到什么,一个在研究 Agent 到底能被拆成多少块。
15
1
16
4,207
Pi 和 DeepSeek Harness 有什么区别,我用下面三点带你逐层拆解🔥 很多人问我 DeepSeek harness 和 PI 有什么区别? 我直接用他们的标语来告诉你: Pi 的标语: “There are many agent harnesses, but this one is yours.” DeepSeek Harness 的标语: “Everything is a Plugin.” 这句话其实就是他们设计的内核,一个是属于你的 Agent 一个是把 Agent 当成积木。 1、Pi:先做减法 Pi 默认连 Sub-agent、Plan Mode、Permission Popup、Todo 都不愿意内置。 核心只负责 Agent Loop、Session、Tool、Context 这些基础东西,需要什么再用 Extension、Skill、Package 往上加。 所以 Pi 给我的感觉一直是: 先给你一个最小底座,剩下的自己决定。 2、DeepSeek Harness:万物皆插件 它反而更激进。 模型、Tool、Skill、Session、Sandbox、Storage、Loop、调度甚至 UI,都可以挂在 Cordis 插件系统上。 但有意思的是,它默认的 Standard Mode 又很完整,Web Search、Plan、Goal、Sub-agent、Workflow 基本都给你配好了。 也就是说: 架构很模块化,但默认体验并不极简。 3、两边真正不同的是“谁来决定 Agent 长什么样” Pi 更像一盒乐高,很多东西官方干脆不替你选。 DeepSeek Harness 则先给你几套完整 Preset,需要的时候再把里面的零件替换掉。 所以同样叫可扩展,我觉得区别还是挺明显的。 Pi 是从少往多搭。 DeepSeek Harness 是先给你一套完整系统,再允许你把任何一块拆掉重装。 我自己最近两个都在看,反而越来越不想问谁更强。 如果想真正理解 Harness,我觉得这两个项目放在一起看特别有意思: 一个在研究 Core 最少能做到什么,一个在研究 Agent 到底能被拆成多少块。
小墨同学
Whisper 统治开源语音识别这么久,终于又看到一个让我想认真对比的新模型了🔥 最近在了解 Hojo-ASR-Multi-V1 这个模型,它和 Whisper 最大的区别,不只是换了个更大的模型,而是连 ASR 的思路都变了。 Whisper 更像是传统的“听清楚然后转文字”。 Hojo 则是: 音频 Encoder + Qwen3-4B Decoder,让大模型直接参与语音理解和输出。 所以我专门把难度往 Whisper 不舒服的地方去调整: 1、普通话 + 四川/川渝方言 2、中文说一半突然切英文 3、Claude Code、Kubernetes 这种技术词直接混着说 4、数字、版本号、缩写,再故意说错后临时改口 5、最后再加一点真实环境噪音 更关键的是,它本身就是冲着多语言去的。 除了中文、英文、粤语、四川话,还支持日语、韩语、德语、法语、西班牙语、葡萄牙语、意大利语、阿拉伯语、俄语等。 这也是我觉得它比单纯“再做一个 Whisper”更有意思的地方。 Whisper 在解决“我说了什么”,Hojo 开始尝试让模型理解“我到底想说什么”。 接下来我准备直接拿同一段: 川渝方言 + 中文 + 英文技术词 + 临时改口 同时丢给 Hojo-ASR-Multi-V1 和 Whisper large-v3。 看看这种地狱难度下,到底谁先听不懂。
11
1
24
11,423
DeepSeek GUI 初体验,你必须知道的五件事🔥 DeepSeek GUI 刚发布,我就直接上手体验了,然后发现里面有几个问题,我把它整理分享出来了 1、第一个 如果有代理网络开了全局模式,记得开代理模式,不然在获取网站信息的时候 可能会出现无法访问的问题,如果是 tun 模式 可以先关掉尝试 2、不要升级、不要升级、不要升级,重要的事情说三遍,升级之后可能出现报错,无法再使用 要重新安装 3、现在还是 R1 版本也就是非正式版,不要把正式的工作移交到 DeepSeek harness 桌面版本,等正式版发布 再把工作迁移过去 4、在使用隔离沙箱的时候 可能会出现权限授权问题,可以关闭沙箱模式,使用全部权限授权的模式,但是一定要注意自己电脑的数据安全 5、登录模式现在变成了授权和 API 两种方式,但是计费都是使用的你官方 DeepSeek 账号的余额,所以两种方式都可以 但是一定要注意余额消耗,我更建议使用授权方式 这样不会存在 API 泄露的风险 这就是我使用下来的体验,我发现它的轨迹模式还挺好用的,后面我会深度体验尝试一下 如果感兴趣可以关注我,我后面会持续分享!
DeepSeek 终于发布了 GUI,第一时间测评🔥 DeepSeek偷偷摸摸发布了 GUI 版本,梁总真的是一点营销都不做🤣 1、不再是简单的 web 版本 而是一个单独的软件,现在推出了 Windows 和 Mac 两个版本 2、DeepSeek harness 相关的插件都可以直接迁移,直接可以拿来使用 3、DeepSeek harness 相关的模式也都是一样的,而且可以使用官方账号的方式登录 其他更多的我还在探索阶段,如果有新的进展 会第一时间分享出来 下载地址我放评论区了,感兴趣的可以获取一下
11
27
11,535
DeepSeek 终于发布了 GUI,第一时间测评🔥 DeepSeek偷偷摸摸发布了 GUI 版本,梁总真的是一点营销都不做🤣 1、不再是简单的 web 版本 而是一个单独的软件,现在推出了 Windows 和 Mac 两个版本 2、DeepSeek harness 相关的插件都可以直接迁移,直接可以拿来使用 3、DeepSeek harness 相关的模式也都是一样的,而且可以使用官方账号的方式登录 其他更多的我还在探索阶段,如果有新的进展 会第一时间分享出来 下载地址我放评论区了,感兴趣的可以获取一下
最近这个 Fotor Agent 风有点大,好多博主都在用它做视频 我拿它做了一个挺变态的测试: 让 AI 不靠 3D 软件,直接硬算一条苹果风的耳机拆解广告 经常做数码视频的都知道,这类广告最难做: 悬浮在黑色空间、镜头推进、耳机和充电盒瞬间爆炸拆解,外壳、芯片、扬声器在空中悬浮,镜头穿越零件,最后再一点点吸附回原样 以前这种镜头,基本必须在 Cinema 4D / Blender 里建模做动画,外包报价少说几万块 这次我没有给它准备任何 3D 资产,只在 Fotor Agent 里发了一段带有: 微距、爆炸拆解、零件悬浮、机械组装 的 Prompt。 跑完之后,我发现它的全流程逻辑,和普通 AI 视频工具有本质区别。 1️⃣ 它先强制卡死分镜(Storyboard) 它没有一上来就盲目抽卡生成 MP4,而是先把 30 秒视频拆成完整的镜头结构。 什么时候出现微距、什么时候做爆炸拆解、节奏怎么排,先把分镜逻辑定下来。 确认无误之后,才继续往下生成。 2️⃣ 先锁死图片资产,再跑视频 很多 AI 视频最大的问题,就是前后镜头的主体根本对不上。 Fotor Agent 是先围绕分镜,把同一套耳机的材质、零件图生成出来,再拿这些资产去跑动态。 所以整个拆解过程中,芯片、外壳这些核心零件的一致性非常好。 3️⃣ 音效 + 多轨工程输出 爆炸拆解时的机械运动声音、转场音效,都是跟着画面同步生成的。 最硬核的是: 它最后吐给你的不是一个死板的 MP4,而是一个完全开放的多轨工程。 比如拆解过程中某一段配文不对,或者某个转场音效不满意,可以直接在画布上修改。 甚至直接继续跟它对话,让它帮你改。 不用因为一个小地方不满意,就把整条视频重新渲染一遍。 这点真的太省钱了。 顺便看了一下成本。 这种 原生 4K 级动效成片,算下来一条 30 秒视频成本大概 $3 左右,平均每秒不到 10 美分。 以前我觉得 AI 做视频,核心只是生成一段画质不错的片段。 但实际做商业视频之后会发现: 真正难的不是“生成一个片段”,而是前期的资产对齐 + 后期的多轨直改。 能把抽卡生成的片段,真正组装成一条可以继续修改的商业成片,这才是 Agent 视频和普通 AI 视频工具最大的区别。 链接挂评论区了。 做数码、产品宣传或者商业广告的,可以拿一些复杂的案子去喂喂看
13
2
31
33,920
DeepSeek Harness GUI 官方Windows版本下载 download.deepseek.com/dsh-de… DeepSeek Harness Mac客户端下载 download.deepseek.com/dsh-de…
12
23,421
闲鱼上卖 29的 Muse 注册教程,一分钟教会你🔥 现在用 Grok BOT 注册已经不行了,但是谷歌的Spark注册还是可以的 而且能直接登录激活,直接送 10 亿的 token 整个流程三步: 1、Gemini 切到 Spark,打开远程浏览器,再 Take over 接管 2、在远程浏览器完成邮箱、生日、验证码和官方年龄验证 3、回到本地安装 Muse,用同一个邮箱登录 辅助功能和录屏权限可以先跳过,后面需要再开 全程没什么难度,只要有手就行,赶紧学起来 你也可以去闲鱼开店了
58
22
5,463
Pi 和 Codex Token 消耗差距有多大?整整 12 倍🔥 很多人都知道PI 省 token,但是具体有多省 token 没有一个具体的量化标准和感知,我就跑了 3 个任务 然后把消耗的 token 都量化出来 同一个 gpt-6-sol(medium),让 Codex CLI 和 Pi 各完成 3 个小任务。每项都从新会话开始,6 次运行全部通过测试。记录的是完整任务的总 token: 1、修复时长格式化:Codex 99,880 / Pi 6,083,相差 16.4 倍 2、合并时间区间:Codex 100,453 / Pi 6,087,相差 16.5 倍 3、解析一行 CSV:Codex 79,145 / Pi 10,904,相差 7.3 倍 三项合计:279,478 / 23,074,Codex 约为 Pi 的 12.1 倍。差距主要来自输入上下文 任务都是一致的 而且输入也是一致的,但是最终的消耗却差 12 倍,这中间绝大部分都是系统提示词和对应的 skill 和插件 如果你想省 token,那不用想 直接用 PI 就对了!
Pi 配上 Gemini 速度飞快,推荐大家尝试一下🔥 推荐一个插件:pi-gemini-acp 可以在 PI 上直接使用 Gemini 的模型,像最新的 Gemini 3.8 flash 它都是支持的 优势: 1、不是通过反代的方式,让我们的 PI 可以去使用 Gemini 的模型 2、不管是最新的还是以前的模型 只要 Gemini 支持 都可以在 PI 里面调用 而且可以分配不同的线程去使用 3、Flash 本来就输出速度非常快,加上 PI 干净的上下文 干起活来速度很快 我自己最近开始尝试 Gemini 去写一些东西,主要是现在 Codex 和 Cloud Code 都有一点算力紧张,所以就开始尝试谷歌的模型 一般都是拿来排查前端和写一些内容,相对来说 谷歌的 AI 味是没有 codex 那么重的,这个大家可以去尝试一下
3
38
49,438
Pi 配上 Gemini 速度飞快,推荐大家尝试一下🔥 推荐一个插件:pi-gemini-acp 可以在 PI 上直接使用 Gemini 的模型,像最新的 Gemini 3.8 flash 它都是支持的 优势: 1、不是通过反代的方式,让我们的 PI 可以去使用 Gemini 的模型 2、不管是最新的还是以前的模型 只要 Gemini 支持 都可以在 PI 里面调用 而且可以分配不同的线程去使用 3、Flash 本来就输出速度非常快,加上 PI 干净的上下文 干起活来速度很快 我自己最近开始尝试 Gemini 去写一些东西,主要是现在 Codex 和 Cloud Code 都有一点算力紧张,所以就开始尝试谷歌的模型 一般都是拿来排查前端和写一些内容,相对来说 谷歌的 AI 味是没有 codex 那么重的,这个大家可以去尝试一下
分享Pi 使用 GPT 新模型,结果有点反直觉🔥 GPT 出新模型Luna、Sol、Astra,用了几天来分享一下自己这几天的使用成果,很多时候我还是在用 5.6 Sol 在干活,虽然 GPT6 Sol 价格变低了,但是整体效果很差。 我现在基本会这样用: 1、5.6 Sol|做兜底 任务 GPT6 的价格虽然变低了,但是整体的稳定性有点差,在执行长任务的时候 我还是更喜欢切换到 5.6 Sol,不知道是暂时性的 还是一直会这样 我都是拿来做长任务的兜底 2、Luna|负责大量日常任务 该处理一些小任务 比如:读文件、搜索、小改动、跑测试、资料整理、简单 Tool Call,甚至很多 Sub-agent 任务,我都会直接丢给Luna模型 速度快、成本低,很适合当 Pi 里面的“常驻工人”。 3、Sol|负责真正的主任务 复杂 Coding、跨文件修改、Debug、长任务,或者需要连续很多轮 Tool Call,我会直接上 Sol。 它更像 Pi 里面真正负责干活的主力 4、Astra|只负责最难的部分 架构设计、复杂规划、最终 Review,或者 Sol 已经开始绕路的时候,再把 Astra 叫出来。 重点是这次模型的能力提升不是很大,但是相对应的价格降低了很多,我们可以干更多的事情 但是如果发现不对的时候,超过两次没有解决你的问题 就可以切回 5.6 模型去干活,你会回来谢谢我的
13
15
133
42,426
分享Pi 使用 GPT 新模型,结果有点反直觉🔥 GPT 出新模型Luna、Sol、Astra,用了几天来分享一下自己这几天的使用成果,很多时候我还是在用 5.6 Sol 在干活,虽然 GPT6 Sol 价格变低了,但是整体效果很差。 我现在基本会这样用: 1、5.6 Sol|做兜底 任务 GPT6 的价格虽然变低了,但是整体的稳定性有点差,在执行长任务的时候 我还是更喜欢切换到 5.6 Sol,不知道是暂时性的 还是一直会这样 我都是拿来做长任务的兜底 2、Luna|负责大量日常任务 该处理一些小任务 比如:读文件、搜索、小改动、跑测试、资料整理、简单 Tool Call,甚至很多 Sub-agent 任务,我都会直接丢给Luna模型 速度快、成本低,很适合当 Pi 里面的“常驻工人”。 3、Sol|负责真正的主任务 复杂 Coding、跨文件修改、Debug、长任务,或者需要连续很多轮 Tool Call,我会直接上 Sol。 它更像 Pi 里面真正负责干活的主力 4、Astra|只负责最难的部分 架构设计、复杂规划、最终 Review,或者 Sol 已经开始绕路的时候,再把 Astra 叫出来。 重点是这次模型的能力提升不是很大,但是相对应的价格降低了很多,我们可以干更多的事情 但是如果发现不对的时候,超过两次没有解决你的问题 就可以切回 5.6 模型去干活,你会回来谢谢我的
Pi 使用 GPT-6 ,你必须知道的五件事🔥 总结成一句话就是:GPT-6 Sol、GPT-6 Luna更便宜直接换,模型更聪明,适当做减法 1、别默认 Max 日常 Coding 直接 Sol high,真遇到复杂架构和长链 Debug 再上 xhigh / max。 2、优先 Responses API 自己接 Provider 或中转时,GPT-6 尽量走 openai-responses,工具调用和 reasoning 更完整。 3、Skill 开始做减法 少写“第一步、第二步、必须先做什么”, 只留: 背景 + 边界 + 验收标准。 4、别把 1M 上下文塞满 超过 272K 后成本会明显增加,长任务还是要主动 /compact,必要时直接告诉 Pi 重点保留什么。 5、模型分层用 Luna 跑普通任务,Sol high 做主力,Astra 留给真正难的问题
7
12
35,102
Whisper 统治开源语音识别这么久,终于又看到一个让我想认真对比的新模型了🔥 最近在了解 Hojo-ASR-Multi-V1 这个模型,它和 Whisper 最大的区别,不只是换了个更大的模型,而是连 ASR 的思路都变了。 Whisper 更像是传统的“听清楚然后转文字”。 Hojo 则是: 音频 Encoder + Qwen3-4B Decoder,让大模型直接参与语音理解和输出。 所以我专门把难度往 Whisper 不舒服的地方去调整: 1、普通话 + 四川/川渝方言 2、中文说一半突然切英文 3、Claude Code、Kubernetes 这种技术词直接混着说 4、数字、版本号、缩写,再故意说错后临时改口 5、最后再加一点真实环境噪音 更关键的是,它本身就是冲着多语言去的。 除了中文、英文、粤语、四川话,还支持日语、韩语、德语、法语、西班牙语、葡萄牙语、意大利语、阿拉伯语、俄语等。 这也是我觉得它比单纯“再做一个 Whisper”更有意思的地方。 Whisper 在解决“我说了什么”,Hojo 开始尝试让模型理解“我到底想说什么”。 接下来我准备直接拿同一段: 川渝方言 + 中文 + 英文技术词 + 临时改口 同时丢给 Hojo-ASR-Multi-V1 和 Whisper large-v3。 看看这种地狱难度下,到底谁先听不懂。
Clean audio is easy. Real conversations aren’t. People switch languages halfway through a sentence. They change their minds, speak over traffic noise, use bad microphones — and still expect the model to keep up. So we want to test the messy stuff. Send us a short, non-sensitive audio sample or tell us about a difficult voice scenario. We’ll test it with Hojo-ASR-Multi-V1 and share what works, what doesn’t, and where the model still needs improvement. What should we test first? Model: huggingface.co/HojoAI/Hojo-A…
11
10
17
8,603
Pi 学习路上最好的文章,都在一个网站🔥 文章地址:earendil.com/posts/ 1、Measuring the Sloppiness of Code 2、There are many agent harnesses, but this one is mine. 3、What is a Harness? 4、How Compaction Works in Pi 5、Pi, Minimal and Performant 6、The Session You Cannot Take With You 7、Prompt Caching In Agents 非常建议大家都去看一遍,你会对整个 Agent 的设计和原理都有一个很深的理解
Pi v0.87.1 刚发布,最新模型全部支持🔥 Claude Opus 5.5、GPT-6 Sol / Luna都在默认支持列表,这更新速度是真快 比较值得关注的就这几个: 1、Claude Opus 5.5|支持 Adaptive Thinking + 1M Context 2、GPT-6 Sol / Luna|OpenAI API、Codex 订阅和 GitHub Copilot 都可以用了 3、Grok 4.7|现在直接变成 xAI 默认模型 另外还顺手修了一些 Compaction、图片输入和 Anthropic OAuth 的小问题,整体更像一次模型适配和稳定性更新。
6
12
101
10,291