Personal AI. Local-first. For the inner life. 2× DGX Spark · M4 Max 128GB

Based in United States
opus-5.5 做 html 动画真是太强了。 随便一段素材, 都可以做出精美且达意清晰的视频来。
我一直持有, 开源模型加硬件的持续提高性能, 会让消费级算力慢慢具有性价比和可用性。 随后,飞入寻常百姓家。 可是最近当我开始持续做 类似 RSI 的软件流水线优化之后, 例如针对某个bug建立隔离环境做回归测试, 这里称之为 bug v0, 让 agent 自主探索解决方案。 这里称之为测试 v1。 随后,再将这套,遇到bug建立回归测试,再抽象沉淀成 回归测试模板。 然后让 回归测试模版 本身,继续建立一套 隔离测试机制,对 回归测试本身进行 优化的测试,看 回归测试模版本身如何更快促进 bug 修复的速度和节省token,减少 model调用测试。 这里称之为测试v2。 于是我得到了, 对 bug v0 的改进环境 v1, 对 环境 v1的 改进测试环境 v2, 且理论上,v2 还可以再套一层 v3 继续来优化。 这样, 不仅是 显卡算力干活的 token量暴增, 还有用于测试环境隔离的sandbox,需求量也会暴增, cpu 硬盘 内存 网线等等都会倍增。 而一旦某个行业某个业务开启了这种 RSI 迭代式增长, 先发者总是拥有两位数到三位数百分比的速度、成本优势, 将会导致,追赶者,无法搭顺风车,要么一次性投入更多的token 和硬件,提高迭代的加速度,用更高的增长速度超过先发者,拿到行业的利润大头。要么干脆这一块放弃了,追赶的大量投入会削弱短期内的利润率,也会刺激先发者加快投入进行迭代,造成零和,而先发者的市场占有率优势,和基础设施积累,又可以快速拉升性能增长率。 所以对于试图高投入超车变得高风险低回报,最终选择放弃。 于是,消费级的本地算力,根本不会像历史上的科技革命,电力、互联网、移动互联网一样走进千家万户。 而更像是一种超过临界点之后的脆断和阶跃,像是图表中拉出了一根垂直起飞的斜线,后来者再做算力部署和数据收集都没有性价比的收益风险比了。 所以,本地算力不会普及,成了一种高度聚集的图钉型算力分布。
1
14
2,725
opus-5.5 在 html 上做动画已经杀死 ppt 等其它视效软件了, 随便一段话,就搞出了 精美的说明动画视频。 关键是,ta清晰地抓住了我的重点,表达了意思,还不需要我多做重点的强调和转场时长的剧本。
我一直持有, 开源模型加硬件的持续提高性能, 会让消费级算力慢慢具有性价比和可用性。 随后,飞入寻常百姓家。 可是最近当我开始持续做 类似 RSI 的软件流水线优化之后, 例如针对某个bug建立隔离环境做回归测试, 这里称之为 bug v0, 让 agent 自主探索解决方案。 这里称之为测试 v1。 随后,再将这套,遇到bug建立回归测试,再抽象沉淀成 回归测试模板。 然后让 回归测试模版 本身,继续建立一套 隔离测试机制,对 回归测试本身进行 优化的测试,看 回归测试模版本身如何更快促进 bug 修复的速度和节省token,减少 model调用测试。 这里称之为测试v2。 于是我得到了, 对 bug v0 的改进环境 v1, 对 环境 v1的 改进测试环境 v2, 且理论上,v2 还可以再套一层 v3 继续来优化。 这样, 不仅是 显卡算力干活的 token量暴增, 还有用于测试环境隔离的sandbox,需求量也会暴增, cpu 硬盘 内存 网线等等都会倍增。 而一旦某个行业某个业务开启了这种 RSI 迭代式增长, 先发者总是拥有两位数到三位数百分比的速度、成本优势, 将会导致,追赶者,无法搭顺风车,要么一次性投入更多的token 和硬件,提高迭代的加速度,用更高的增长速度超过先发者,拿到行业的利润大头。要么干脆这一块放弃了,追赶的大量投入会削弱短期内的利润率,也会刺激先发者加快投入进行迭代,造成零和,而先发者的市场占有率优势,和基础设施积累,又可以快速拉升性能增长率。 所以对于试图高投入超车变得高风险低回报,最终选择放弃。 于是,消费级的本地算力,根本不会像历史上的科技革命,电力、互联网、移动互联网一样走进千家万户。 而更像是一种超过临界点之后的脆断和阶跃,像是图表中拉出了一根垂直起飞的斜线,后来者再做算力部署和数据收集都没有性价比的收益风险比了。 所以,本地算力不会普及,成了一种高度聚集的图钉型算力分布。
16
11
1,193
让 opus-5.5 自由发挥自己的创意, 将开发日志-agent工作数据, 做可视化的动画。(左边) 不得不说, opus-5.5 自己的审美太好。 右边视频是我自己构思的 树木生长。
1
7
616
这个月做了一个软件, TUI agent 和 issues看板forgejo的中间桥接 tui-relay, 实现在 issues 看板中和 agent 协作开发。 然后让 opus-5.5 对开发数据做一个动画演示。
4
7
2,402
DGX party!
1
7
548
DGX spark GB10 双机套装 京东自营 破8万后 一下到了8万3
5
19
2,000
明天可以领新版 原创内容奖励 了, 第一期人相对少吧, 不知道会是什么样
4
12
1,810
opus-5.5 默认选 high 就可以了。 从 @cognition 和 @cursor_ai 的评估来看, high 有着相对于 low medium 的显著提高, 档位再调高,成本上去了,提升微乎其微。
30
3
78
13,473
正在流传 opus-5.5 发布于 claude code 新版本
3
12
1,931
从早上磨蹭到现在
1
12
9,211
嗯,原来我的 mac studio 是小贩😂 DGX spark GB10 是环卫工
37
2
29
5,386
😆我预测中了 step-5-preview 一举追上 K3 @StepFun_ai 我包包里的 step max 创世订阅套餐, 又可以大放光彩了。
🤣我觉得这波薅推理轨迹的 最大绝对值提升可能是 阶跃 @stepfun 本来,glm-5.2、 K3 崛起了, 被誉为小型opus, 国产其他家 minimax 、xiaomi有些不明所以, 慢一拍, 现在大家赶紧抓住机会, 一口气也炼上来。
16
75
20,672
codex summer 估计就这样结束了
claude 带来饥荒和焦虑 codex 带来大丰收的富足和喜悦😇 回望 2026春, claude 高光时刻,opus 封神, 是token焦虑,token荒的季节, 在封号、降智的阴影下, 人民骨瘦如柴,吃glm草皮,都要争抢到大打出手。 而在现在 2026年夏, 史书称之为 "codex summer" 定为为 AI发展史上的 著名丰收节日 🎇
8
1,761
devin 的 max 200美元订阅, 等价api价值,大概是 2000美元。 今天刚好用到: 51%。 按token总量折算成USD大概200美元。 一周400美元,按5周算,2000美元。
9
40
8,159
Devin 的 fusion 模式, 跷跷板不明显额, 看着像一直都是 gpt-6-astra 在干活, swe-2划水。 今天白天消耗了 34% 额度.
11
25
3,662
发现 devin 的 fusion 双模型, 是哪个模型在工作, 哪一个变亮, 但是它们会共享缓存吗?
4
15
3,572
DGX spark * 2 跑了两天一夜, Terminus-2 还是跑出来了, 模型是量化加去审查版 官方 fp8 83 nvfp 82 本地量化去审查版 76
6
14
3,021
Terminal-Bench 4.0 倒数前三各有特色 qwen-3.8-27B 作为mini 模型和美国大豆包坐一桌,还是很厉害 DeepSeek-V4-pro-0813,1.6T A49B 连 27B 都打不过🤣 Mercury-2.5 不是自回归,是一个扩散模型,属于扩散界的扛把子了,得分为零,说明主流还是自回归,记得一两年以前一个大咖的访谈也提过。
3
24
4,647
Terminal-Bench 4.0 第一,deepseek-v4-pro-0813 果然练崩了啊, 一上线第一天就感觉不对劲, 测出来垫底,还打不过自家flash。 第二,国模 性价比 顶美 交棒给 glm-5.3-flash 第三,claude 继续又贵又能打的高冷风
12
26
8,080
devin 的 fusion 模式 现在可选的是: lead: fable-5.1 gpt-6-astra opus-5 sidekick: SWE-2 gpt-5.6 sol & luna glm-5.2
5
1
10
2,919
Devin 启动! @devindesktop
9
24
4,682
原来codex 付费重置一次要 80美元, 然后还是立即算第一天。
10
19
8,770
DGX 还是太慢了。 双机推理 qwen-3.8-flash-next q4 , 跑 Terminus-2 的 eval 。 六路并发跑得快, 但是有超时错误。 早上开两路把剩余的给断点续跑看看, 到了晚上,跟我说还要15个小时。
对 双机DGX推理 qwen-3.8-flash-next 量化uncensored 做评测之后, 发现大概 C2-C3比较性价比, C2 单路中位数 / 聚合 36.58 / 69.68 tok/s C4以上单路有些太慢了
16
9
3,975
今天尝试复现 harness 和 model一起训练的 WHALE 没有跑出来
1
8
1,368
把 ninfer 移植给 DGX spark + qwen-3.8-27B nvfp4 现在可以运行了。
34
9
2,657
阶跃 是已经自我放弃了嘛🥲 给 千问办公 带货
59
26
3,208
没有gpt pro 20x的话, 也不要 5x 买两个,plus 买10个来凑数。 20x 是 token半价的, 我没测过, 数据来自于 @Fei2411 的 real-api-pricing
31
3
42
13,680
Behind the scene I’ve been continuing the MCDMA development. Next phase is gonna be exciting.
6
725
DeepSeek-V4.1-Flash + deepseek harness 确实如@tianyi宣传所说,强到爆炸啊。 @guanlan 的 frontier-harness-eval , 其中 cost 更是数量级地碾压一切其它组合 又快又省又好 provider : opencode go 图一
12
3
64
19,423
我很好奇, 官方说大鲸鱼+坐骑组合很厉害。 到底有多厉害。 为了测试一下 DeepSeek-V4.1-Flash + deepseek harness 是否有官方说得这么炸裂, 我决定掏出祖传的 deepseek 陈年老 key,2024年的 今晚挂机跑一下评测。 😂
5
19
8,268
开源model + agent 哪家性价比高? 使用 @guanlan 的 frontier-harness-eval 。 在 K3 之外补充测了 glm-5.3 + - claude code - codex - pi - opencode provider :智谱官方订阅
22
4
50
104,092
tibo 言出法随这么快嘛? chatgpt PRO 20x google play已经升级不了🥲 10x还可以
61
23
23,420
opencode + glm-5.3 frontier-harness-eval 跑分 opencode 也很弱啊了。
13
14
3,659
因为 frontier-harness-eval 的 底座是 K3 , @guanlan 测出来 claude code 又慢又贵,双重垫底。 所以我很好奇, 于是底座换成 glm-5.3 ,得出的结果如下, glm-5.3+claude code 一下子起飞了。
11
21
3,469