Personal AI. Local-first. For the inner life. 2× DGX Spark · M4 Max 128GB

发现现在agent编程, 带着一种 hack 精神, 如果提示词里的护栏不够多的, 一不留神, agent会用一种思路清奇和诡异的方式来实现, 然后也不能说是错的, 按提示词和测试来说, 全是合格的, 但是埋下了一个坑,很久才会发觉,原来当时是这么处理的。 🤪 所以有人说agent是被污染的黑圣杯,很形象。
2
6
486
耳机音响有煲机, claude账号也可以煲? 😅
Claude 避免封号焚决: 新号煞有介事地开始构建或者探讨极为艰深的科学问题。 Claude 后端必有一个账户打标机制。 它也想要科学家和高级工程人士的生产协作数据。 被封号,因为它判断你是一个麻瓜。 (本推文不改变 A 畜本质。咱们一起玩儿它)
1
3
917
LotusDecoder retweeted
The need for INSANE speed? Yes ⚡️ DeepSeep v4.1 Flash for 4x DGX Sparks is getting... ridicules 🤯 Decode improvements - Prose decode is now 87 tok/s single stream - On 4 streams it's 163.6 tok/s - Code decode is 124.8 tok/s single stream - On 4 streams it's 246.8 tok/s Prefill numbers? 5800-5925 tok/s on 16k-128k 5394 tok/s on 256k It feels like a FAST API! If you have 4x DGX Sparks, you need to try this out ASAP. I wonder if the M5 Ultra 512 GB could beat this. The improvements for now are only for TP=4 and do not effect TP=3. Thanks to @majewskizby for this awesome PR! Get it here: github.com/MiaAI-Lab/DeepSee…
32
18
262
21,206
我觉得很快会超级缺乏 cpu 硬盘 内存。 这波 国产三家 flash 的集中爆发。deepseek glm qwen。 速度更快,成本更低。 gpt luna 的量大管饱。 opus-5.5 的提质降价。 那么以前是任务能做完就ok啦, 现在很快要求,多快好省, 于是送进RSI打磨细节, 要开上并行沙箱, 所以大量需求cpu 内存 硬盘。
14
1
28
2,007
opus-5.5 的缺点也是有的, 主打一个容易丢三落四, 某些细节忽略掉了, 我是发现两回了。😅
13
21
3,584
LotusDecoder retweeted
LLM 就像是被污染的圣杯 你不写个几千行 spec / proposal 敲定每一个细节,它就一定会在某个地方用你所不期望的方式实现你的愿望
13
22
363
20,547
AI行业选吉祥物的话, 大概是鹈鹕吧。
1
10
942
LotusDecoder retweeted
Astra is still the best "review" model. It's so insanely thorough.
115
40
2,203
107,095
让 claude opus-5.5 画画可太好玩了, 一个大语言模型, 为什么像是特效视频生成模型。 😅
3
13
1,480
opus-5.5 制作精美html动画提示词: 自由发挥你的创造力,创意,发散思维, 再结合你最大的审美、美工、开发技术能力, 为以下文章设计和编写一个动态动画的 html 文件。 不要 ppt 式的翻页展示静态页面、局部动态元素这种伪动画。
opus-5.5 做 html 动画真是太强了。 随便一段素材, 都可以做出精美且达意清晰的视频来。
1
7
865
opus-5.5 做 html 动画真是太强了。 随便一段素材, 都可以做出精美且达意清晰的视频来。
我一直持有, 开源模型加硬件的持续提高性能, 会让消费级算力慢慢具有性价比和可用性。 随后,飞入寻常百姓家。 可是最近当我开始持续做 类似 RSI 的软件流水线优化之后, 例如针对某个bug建立隔离环境做回归测试, 这里称之为 bug v0, 让 agent 自主探索解决方案。 这里称之为测试 v1。 随后,再将这套,遇到bug建立回归测试,再抽象沉淀成 回归测试模板。 然后让 回归测试模版 本身,继续建立一套 隔离测试机制,对 回归测试本身进行 优化的测试,看 回归测试模版本身如何更快促进 bug 修复的速度和节省token,减少 model调用测试。 这里称之为测试v2。 于是我得到了, 对 bug v0 的改进环境 v1, 对 环境 v1的 改进测试环境 v2, 且理论上,v2 还可以再套一层 v3 继续来优化。 这样, 不仅是 显卡算力干活的 token量暴增, 还有用于测试环境隔离的sandbox,需求量也会暴增, cpu 硬盘 内存 网线等等都会倍增。 而一旦某个行业某个业务开启了这种 RSI 迭代式增长, 先发者总是拥有两位数到三位数百分比的速度、成本优势, 将会导致,追赶者,无法搭顺风车,要么一次性投入更多的token 和硬件,提高迭代的加速度,用更高的增长速度超过先发者,拿到行业的利润大头。要么干脆这一块放弃了,追赶的大量投入会削弱短期内的利润率,也会刺激先发者加快投入进行迭代,造成零和,而先发者的市场占有率优势,和基础设施积累,又可以快速拉升性能增长率。 所以对于试图高投入超车变得高风险低回报,最终选择放弃。 于是,消费级的本地算力,根本不会像历史上的科技革命,电力、互联网、移动互联网一样走进千家万户。 而更像是一种超过临界点之后的脆断和阶跃,像是图表中拉出了一根垂直起飞的斜线,后来者再做算力部署和数据收集都没有性价比的收益风险比了。 所以,本地算力不会普及,成了一种高度聚集的图钉型算力分布。
1
14
2,630
LotusDecoder retweeted
Everyone is posting 3 and 4 Spark clusters this week. Here is what ONE DGX Spark does for one user, all measured on my box: MiniCPM5-2B, OpenBMB's drafter on: 100.8 tok/s Qwen3.6-35B-A3B: 89.7 Ling-3.0-flash: 69.5 Qwen3.8-Flash-Next: 55.5 DeepSeek-V4-Flash: 47.9 in EXL3 Gemma-4-E2B: 39.2 Qwen3.8-27B: 33.4 EXL3 + DFlash2 Tinfield-1 at 2-bit: 30.7 One model at a time, 256 tokens in, 256 out
20
10
76
4,176
opus-5.5 在 html 上做动画已经杀死 ppt 等其它视效软件了, 随便一段话,就搞出了 精美的说明动画视频。 关键是,ta清晰地抓住了我的重点,表达了意思,还不需要我多做重点的强调和转场时长的剧本。
我一直持有, 开源模型加硬件的持续提高性能, 会让消费级算力慢慢具有性价比和可用性。 随后,飞入寻常百姓家。 可是最近当我开始持续做 类似 RSI 的软件流水线优化之后, 例如针对某个bug建立隔离环境做回归测试, 这里称之为 bug v0, 让 agent 自主探索解决方案。 这里称之为测试 v1。 随后,再将这套,遇到bug建立回归测试,再抽象沉淀成 回归测试模板。 然后让 回归测试模版 本身,继续建立一套 隔离测试机制,对 回归测试本身进行 优化的测试,看 回归测试模版本身如何更快促进 bug 修复的速度和节省token,减少 model调用测试。 这里称之为测试v2。 于是我得到了, 对 bug v0 的改进环境 v1, 对 环境 v1的 改进测试环境 v2, 且理论上,v2 还可以再套一层 v3 继续来优化。 这样, 不仅是 显卡算力干活的 token量暴增, 还有用于测试环境隔离的sandbox,需求量也会暴增, cpu 硬盘 内存 网线等等都会倍增。 而一旦某个行业某个业务开启了这种 RSI 迭代式增长, 先发者总是拥有两位数到三位数百分比的速度、成本优势, 将会导致,追赶者,无法搭顺风车,要么一次性投入更多的token 和硬件,提高迭代的加速度,用更高的增长速度超过先发者,拿到行业的利润大头。要么干脆这一块放弃了,追赶的大量投入会削弱短期内的利润率,也会刺激先发者加快投入进行迭代,造成零和,而先发者的市场占有率优势,和基础设施积累,又可以快速拉升性能增长率。 所以对于试图高投入超车变得高风险低回报,最终选择放弃。 于是,消费级的本地算力,根本不会像历史上的科技革命,电力、互联网、移动互联网一样走进千家万户。 而更像是一种超过临界点之后的脆断和阶跃,像是图表中拉出了一根垂直起飞的斜线,后来者再做算力部署和数据收集都没有性价比的收益风险比了。 所以,本地算力不会普及,成了一种高度聚集的图钉型算力分布。
16
11
1,174
我一直持有, 开源模型加硬件的持续提高性能, 会让消费级算力慢慢具有性价比和可用性。 随后,飞入寻常百姓家。 可是最近当我开始持续做 类似 RSI 的软件流水线优化之后, 例如针对某个bug建立隔离环境做回归测试, 这里称之为 bug v0, 让 agent 自主探索解决方案。 这里称之为测试 v1。 随后,再将这套,遇到bug建立回归测试,再抽象沉淀成 回归测试模板。 然后让 回归测试模版 本身,继续建立一套 隔离测试机制,对 回归测试本身进行 优化的测试,看 回归测试模版本身如何更快促进 bug 修复的速度和节省token,减少 model调用测试。 这里称之为测试v2。 于是我得到了, 对 bug v0 的改进环境 v1, 对 环境 v1的 改进测试环境 v2, 且理论上,v2 还可以再套一层 v3 继续来优化。 这样, 不仅是 显卡算力干活的 token量暴增, 还有用于测试环境隔离的sandbox,需求量也会暴增, cpu 硬盘 内存 网线等等都会倍增。 而一旦某个行业某个业务开启了这种 RSI 迭代式增长, 先发者总是拥有两位数到三位数百分比的速度、成本优势, 将会导致,追赶者,无法搭顺风车,要么一次性投入更多的token 和硬件,提高迭代的加速度,用更高的增长速度超过先发者,拿到行业的利润大头。要么干脆这一块放弃了,追赶的大量投入会削弱短期内的利润率,也会刺激先发者加快投入进行迭代,造成零和,而先发者的市场占有率优势,和基础设施积累,又可以快速拉升性能增长率。 所以对于试图高投入超车变得高风险低回报,最终选择放弃。 于是,消费级的本地算力,根本不会像历史上的科技革命,电力、互联网、移动互联网一样走进千家万户。 而更像是一种超过临界点之后的脆断和阶跃,像是图表中拉出了一根垂直起飞的斜线,后来者再做算力部署和数据收集都没有性价比的收益风险比了。 所以,本地算力不会普及,成了一种高度聚集的图钉型算力分布。
3
1
25
11,348
LotusDecoder retweeted
Google 开源了 "Agent 工作负载的 Kubernetes"「AX」 AX 是为 Agent 设计的声明式编排运行时,你用 YAML 声明一个 Agent 任务,AX 负责在集群中沙箱化、配置环境、管控网络并大规模运行它。 开源地址:github.com/google/ax 它解决什么问题 项目的立论很清晰:Agent 是一种既有的编排体系都不匹配的新型工作负载。 · 它不像微服务(无状态、常驻),Agent 会持续积累状态(对话记忆、工作区文件、工具会话); · 它不像批处理作业(跑完即弃),Agent 大部分时间在等待,等模型响应、等工具返回、等人类审批,期间沙箱空转烧钱; · 它运行的是不可信代码,需要严格隔离;它还调用外部模型 API 和 MCP 工具服务器,需要网络与凭据管控。 架构:四个二进制 + Redis 四个二进制分工:ax(开发者 CLI)、ax-server(无状态 gRPC API)、ax-controller(调和循环)、ax-task-runner(每个任务容器内的 PID 1)。 核心原语:Task / Workspace / Model (+ Gateway) Task 是最小执行单元:带 CPU/内存限制的隔离沙箱。AX 刻意把它做得细粒度、可自由组合:一个任务可以是全部工作,也可以是任务树的根节点。生命周期用 status.phase + Conditions 表达,支持挂起(检查点保存状态)与恢复。 Workspace 是最有产品想象力的一层。它把“环境准备”声明化:列出需要的 Git 仓库、MCP 服务器、技能包,runner 在命令启动前物化好。更激进的是 generative workspace:你可以只写一句自然语言目标("搭一个 Python 3 开发环境"),首次启动时 runner 会派一个引导 Agent(Antigravity,需 GEMINI_API_KEY,默认限时 10 分钟)去实际安装工具链并验证依赖。声明一次,任意任务复用。 Model 把“用哪个模型、什么参数、密钥在哪”抽成命名资源,密钥引用 K8s Secret。轮换密钥、锁版本、调温度只需一次 ax apply。 沙箱与运行时细节 每个任务容器以 ax-task-runner 为 PID 1:启动元数据服务(端口 80,HTTP/1.1+h2c,暴露 /healthz、/readyz 和任务/工作区自省端点——Agent 不需要 SDK 就能读到自己的配置)、按绑定顺序初始化工作区、然后 fork 出 spec.command 并持续监管。命令退出后 runner 仍驻留,所以 ax ssh 和元数据服务在命令结束后依然可用。停机采用 SIGTERM + 10 秒宽限 + 强杀的两级策略。 安全模型有几处值得注意的门控:guest 服务(任意进程执行与文件读写,ax ssh 的底层)默认关闭,只在 debug: true 时开启——ax ssh 连不上未开启的任务是刻意的安全设计,不是故障;Gateway 用显式 allowlist 管控出站流量,并可向入站请求注入凭据,避免把 API key 直接塞进 Agent 环境。 路线图透露的方向 五大方向:Actor 架构深化、空闲检测自动挂起、有状态任务 fork、任务级 SPIFFE 身份做零信任 mTLS、runner 层自动采集 OpenTelemetry 遥测与结构化 Agent 轨迹。
5
3
19
2,347
这是亲身经验的金玉良言
架構是長出來的,不是設計出來的。 使用「設計架構」一詞,是方便敘事,並不是真的能夠未卜先知。
5
1,032
LotusDecoder retweeted
Qwen3.8 27B is so good: it can solve nearly 90% of DeepSWE tasks. I varied reasoning mode, agent harness, and quantization. I ran 20 independent runs to see what matters most. For real use cases, if you have a good verifier/tests, try medium reasoning twice. If both attempts fail, switch to xhigh for the third. And whether you use NVFP4, FP8, or BF16, it doesn't matter much. I published the full results, retry strategies, cost analysis, and all the details here: kaitchup.substack.com/p/boos… I wonder whether it can also climb Terminal Bench 4.0 like this. Could be too difficult.
28
24
303
14,780
让 opus-5.5 自由发挥自己的创意, 将开发日志-agent工作数据, 做可视化的动画。(左边) 不得不说, opus-5.5 自己的审美太好。 右边视频是我自己构思的 树木生长。
1
7
605
opus-5.5 的审美还是绝了啊, 让 opus-5.5 自由发挥做动画。 估计比我自己构思的树木创意还好。 正在录视频,等一下发出来。
这个月做了一个软件, TUI agent 和 issues看板forgejo的中间桥接 tui-relay, 实现在 issues 看板中和 agent 协作开发。 然后让 opus-5.5 对开发数据做一个动画演示。
3
6
1,123
LotusDecoder retweeted
進入 AI 紀元後原本的老師、專家皆已不算數,年輕人最大的本錢就是彈性高、速度快、未僵化且擁有大量失敗的機會,而 AI 出現正好完美契合這些特質,因此現在是最有利年輕朋友們一舉推翻固有職涯階梯與社會排序的良機,你唯一要做的就是千萬別抗拒變化而勇敢擁抱與嚐試新科技以增加自己的幸運面就行!😘
2
5
41
1,290