Testing Al tools, exploring trends sharing what works For Collab DM for paid collaboration 📨Reenakhan9027@gmail.com wa.me/971502356067

California, USA
I have a theory that AI filters are becoming the new version of trying clothes on in a fitting room. You tell yourself you’re just going to test one thing. Then suddenly you’ve tried 14 completely different aesthetics and started questioning decisions you’ve been making for the last five years. I opened Glam AI because I wanted to edit one photo and ended up seeing myself with different hair, outfits, makeup, backgrounds and aesthetics. Some were absolutely not me. Some were suspiciously convincing. And now I understand why these apps are addictive. It’s not really about making a “better” version of yourself. It’s getting to test alternate versions without actually committing to any of them.
60
21
229
27,602
There should be a specific term for the pain of looking incredible in a photo while absolutely everything behind you is terrible. Random people. Trash cans. Cars. Someone’s kitchen. A hotel room that looked much nicer on Booking. The one plastic chair that somehow becomes the main character of the picture. I used to just give up on those photos. Now I’ve started putting them into Glam AI and asking the AI chat to replace whatever is bothering me. It feels much more useful than generating an entirely fake version of yourself. I don’t want a new face or body. I just want the universe behind me to cooperate for once.
42
21
206
817
Multimodal AI is moving fast. 🔥 Ling-3.0-flash-VL brings visual understanding, reasoning, document intelligence, visual agents, frontend coding, and more into one model. Excited to see what developers build with this. 🚀
Today, we are releasing Ling-3.0-flash-VL, built on Ling-3.0-flash with visual understanding and visual agent capabilities. It performs well across visual perception, STEM reasoning, document intelligence, multimodal agent tasks, frontend coding, and medical report interpretation.
46
21
195
1,027
Ella Tech & Tool retweeted
我拿 OpenAI Codex 桌面端截了一张图,丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 没拆布局,没写组件清单。 提示词就这一段: 「这是 Codex 桌面端截图。请高度还原成可运行的单文件 HTML。对齐窗口结构、侧边栏、主对话区、输入框、配色、字号、间距和圆角。能看清的文字按原样还原。先渲染一版,再和原图逐项对比,哪里不像改哪里。」 会看图写代码的模型不少。 会盯着 Codex 这种桌面客户端界面,对着自己的渲染结果改到像的,不多。 Ling-3.0-flash-VL 是百灵系列第一个原生多模态模型,在 Ling-3.0-flash 上加了视觉理解和视觉 Agent。 总参数 124B,激活大约 5.5B,支持图、文、视频,上下文 256K。 它不是看完图一次性交卷,而是走「观察 → 行动 → 验证 → 修正」: 截图还原界面,对照渲染结果自己改 当 GUI Agent,点、输、滚、切应用 看视频提问、检索片段 读文档、看医疗报告、做 STEM 视觉推理 前端这块,Image-to-WebDev Arena 成绩高于 GPT-5.4。 纯文本版 AA Index 是 38,加上视觉后到了 42。 你也试一下,3 步就够: 打开 Ling Studio,选 Ling-3.0-flash-VL(免费) chat.ant-ling.com/chat 丢一张 Codex / VS Code / 你常用软件的桌面截图 把下面提示词贴进去,看它怎么还原、怎么改 还原提示词(可直接复制): 这是一张 Codex 桌面端界面截图。请把它高度还原成可直接运行的单文件 HTML。 按桌面应用还原,不要做成网页落地页,也不要做成 ChatGPT 网页版或 VS Code 对齐标题栏、侧边栏会话列表、主对话区、工具调用/代码块、底部输入框 配色、字号、间距、圆角、分割线、栏宽尽量贴近原图 原图能看清的文字按原样还原;看不清的用同等长度占位 先出第一版并渲染,再和原图对比对齐、颜色、组件位置 列出差异后改第二版,直到气质接近 Codex 桌面端 权重已开源,BF16 / FP8 都能下: Hugging Face:huggingface.co/inclusionAI/L… ModelScope:modelscope.cn/models/inclusi… 官方介绍:nitter.net/AntLingAGI/status/2095… @AntLingAGI 别只看评测表,丢一张你桌面上的截图,比什么都准。
Today, we are releasing Ling-3.0-flash-VL, built on Ling-3.0-flash with visual understanding and visual agent capabilities. It performs well across visual perception, STEM reasoning, document intelligence, multimodal agent tasks, frontend coding, and medical report interpretation.
205
86
103
23,710
Ella Tech & Tool retweeted
打开我的B站和Youtube收藏夹 里面的知识视频已经堆积如山了 我有一个想要学习的心 但是一直停留在收存 = 我学了 几乎所有 AI 解法都是视频摘要,出思维导图 我做了一个课程重构项目 重构成能亲手操作实验 现在知识终于能进大脑了
Article

收藏从未停止,学习从未开始:我用Ling-3.0-flash-VL把学习视频拆成能可动手的实验

你是不是和我一样,在 YouTube 或者 B 站里,收藏夹里收藏了一大堆硬核的知识,但是从来没有观看过 我这几天仔细看了一下我的收藏夹,有从入门到精通。Python 有,一小时教你从函数到 Transformer

166
80
101
16,471
Ella Tech & Tool retweeted
蚂蚁百灵昨天发了个多模态模型 Ling-3.0-flash-VL,我测试了一下它的"看图写代码"能力。 丢了一张网页设计图进去,让它直接输出完整 HTML + CSS。 从上传到渲染出页面,全程录屏👇
154
97
93
184,276
Ella Tech & Tool retweeted
1/2) 最近看到一个有意思的技术趋势:大家又开始重新拥抱 Native 了。 Shopify 刚刚宣布,要把移动 App 从 React Native 重新迁回 Swift 和 Kotlin。 更夸张的是,在 Coding Agent 的帮助下,他们只用了 12 周,就把 Shop 从 概念验证做成了已经上架 App Store 的原生应用。 Shopify 给出的理由很直白: 以前选择跨平台,是因为“同一个功能写两遍”太贵。 Notion 其实更早就在走这条路。 它的移动端曾经大量依赖 WebView / React Native,后来为了启动速度、交互体验和系统级控制,一点点把核心界面迁到了原生。 现在也宣布,完全用原生方式重建 Notion 的移动端应用。 why? 因为现在 AI Coding 能力是越来越强,原生开发最大的成本劣势正在快速消失。 所以我最近 Vibe Coding 一个 AI 工具的时候,没有 Electron,没有网页套壳。 我直接就是做成了一个 macOS 原生的实时视觉 AI 助手。 它想解决的问题非常简单: 以前你想问 AI: “右上角那个按钮是什么意思?” “这个公式怎么推出来的?” “第三行这个数字占总数多少?” 你首先得花半天跟 AI 描述—— “我到底在看哪里。” 现在不用了。 在 Mac 上按下快捷键,直接在当前屏幕上: 截图 → 画圈 / 框选 / 箭头标记 → 提问。 AI 直接看懂你指的是哪里,然后秒级流式回答。 整个过程不用切 App,也不需要把截图保存下来,再拖进 ChatGPT。 看到哪里,问到哪里。 一个视觉 AI 助手如果每天要被唤起几十次,它就不应该像一个“网页工具”。 它应该像 Spotlight、截图工具一样,长在操作系统里。 而驱动这个助手的,是蚂蚁百灵刚刚开源的: Ling-3.0-flash-VL。 实际跑下来,我测试了几个特别适合这种 Native + Vision 交互的场景。 ━━━━━ ✨ 场景 1:看到外语,直接圈 碰到英文文档、论文、国外软件界面: 不用复制文字。 直接把屏幕上的区域圈出来,问: “这段是什么意思?” Ling-3.0-flash-VL 会同时利用视觉位置和文字内容进行理解,再把结果流式返回。 相当于给 Mac 加了一个随时可以召唤的视觉翻译层。 ━━━━━ ✨ 场景 2:看到公式,直接问 看论文时遇到复杂的微积分公式、上下标、符号关系: 直接框起来: “给我讲明白这个公式。” 它不仅要 OCR 出字符,还需要理解公式的结构。 实际测试里,它可以继续解释定理、变量含义、推导过程,再用大白话重新讲一遍。 以前是: 截图 → 保存 → 上传 → 描述问题。 现在就是:圈一下。 ━━━━━ ✨ 场景 3:看到数据,直接算 表格可能才是这个交互方式最爽的地方。 我直接用画圈和箭头标出表格里的一个商品,然后问它占比是多少。 它马上识别出我指的是“桃子”,再结合整张表里的数字完成计算: 桃子的销量占比:16.7%。 这里实际上连续做了三件事: 视觉定位 → 语义理解 → 数值计算。 而用户只做了一件事:圈。 ━━━━━ 但 Ling-3.0-flash-VL 真正让我感兴趣的,其实不只是“看图问答”。 它本身就是冲着 长程多模态 Agent 去设计的。 ⚙️ 124B 总参数,单 Token 仅激活 5.5B 采用稀疏 MoE 架构。也就是说,它不是靠把一个巨大的 124B Dense 模型每次完整跑一遍来工作,而是在每次推理时只激活其中一部分专家。 目标就是: 把大模型容量和实时推理效率同时保留下来。 ⚡ 视觉不是外挂,而是原生进入推理链 它原生支持图片、文字和视频。 ViT 负责视觉编码,再把视觉信息真正送进后面的理解、推理、行动与验证流程。 这点很重要。 因为未来的视觉 Agent,并不是: 看图 → 回答一句话。 而应该是: Observe → Act → Verify → Correct 看见界面 → 执行操作 → 再看结果 → 发现错误 → 自己修。 这才是 GUI Agent 真正需要的能力。 📚 256K 长上下文,面向复杂多模态任务 这意味着它不只是适合单张截图问答,也能一次处理更长的文本、更复杂的多图输入,以及持续时间更长的视觉信息。 同时,它还加入了 VideoRoPE 时空编码,让模型不仅能理解“画面里有什么”,还能够结合时间顺序去判断: 什么事情,在什么时候发生。 所以它可以进一步用于长视频理解、事件检索、片段定位,以及更复杂的多模态 Agent 工作流。 对我这个 Mac 原生助手来说,这一点也很重要: 未来它不一定只理解“你刚刚圈的这一块”,还可以结合前后的屏幕内容、历史操作和上下文,持续理解你正在做什么。 💻 对 Agent 和代码生成尤其友好 这也是为什么我觉得它特别适合这个 Mac 助手。 它不仅能够理解: ⭕ 圆圈 ➡️ 箭头 🟨 高亮 ▢ 框选 这些人为添加的视觉提示, 还可以直接: 看 UI → 理解布局 → 写 HTML / CSS / SVG → 再看生成结果。 如果再给 Agent 接一个 Image Diff: 生成页面 ↓ 截图 ↓ 和目标图对比 ↓ 发现偏移 ↓ 修改代码 ↓ 再次截图验证 就可以做出完整的: 「生成 → 看结果 → 对比 → 修改」视觉自愈闭环。 ━━━━━ 而且 Ling-3.0-flash-VL 最近又更新了两个非常关键的东西。 ① API 可以免费玩 Ling-3.0-flash-VL 现在已经上线 OpenRouter, 官方最新活动是:两周免费使用。 所以想复刻类似的视觉 Agent,基本可以直接拿 API 开始测试。 ② 模型已经开源,而且量化版本也补齐了 也就是说,你既可以直接调用 API, 也可以根据自己的硬件环境,选择不同精度版本自己部署。 这对本地视觉 Agent 尤其重要: 云端 API 是最快的起点,本地模型才是隐私和系统级 AI 的终局之一。 ━━━━━ 所以我越来越觉得: Shopify 从 React Native 回到 Swift/Kotlin,其实不只是一次技术栈轮回。 背后更大的变化是: AI 正在重新改写“原生开发到底贵不贵”这笔账。 以前: 跨平台 = 开发快。 原生 = 成本高,但体验好。 现在 Coding Agent 开始承担大量重复实现、迁移、测试和 Review 之后, 这个公式可能变成: AI Coding + Native = 开发效率 + 原生体验。 而视觉模型又给 Native App 增加了一层新的可能: 它不只是“一个带 AI 的应用”。 AI 可以开始直接理解你正在使用的整个操作系统。 以前是: 人费劲地告诉 AI:我在看什么。 以后可能只需要:划个圈。 它就懂了。 附录链接👇
前端哥Liam
157
96
106
27,321
Ella Tech & Tool retweeted
这两天看到我一直很喜欢的设计师阿哲 @Formulasearch 的个人网站,我挺喜欢他个人主页的那个风格。 看着看着突然冒出一个念头: 这种个人审美很强的网站,模型光看录屏,能不能做出来? 于是我顺手录了 10 秒左右,从页面上划过去,直接把视频丢给 Ling-3.0-flash-VL,让它照着做一版。 没给源码,也没拆页面,更没写一大段提示词。输入就那段录屏,加上一句很简单的需求。其实扔进去的时候,我没抱多大期待。视频一晃就过去了,有些细节让我自己暂停看,也未必记得住。 Ling-3.0-flash-VL 是百灵在 Ling-3.0-flash 上加了视觉理解和 visual agent 的版本。官方提到的能力挺多,视觉感知、STEM、文档、前端编码、医疗报告都在里面。我这次没全测,就看一件事:它能不能看完一段网站录屏,真把页面做出来。 结果打开以后,我确实愣了一下。 按肉眼看,和阿哲的原版大概有七成像。大的版式、配色和页面感觉都抓到了,生成出来的也不只是一个摆着看的空壳。按钮能点,交互能跑,放进浏览器里,已经像个可以接着改的半成品。 当然,剩下那三成也挺明显。风格不够细腻,字体没那么贴,交互还是有点僵,一些细节只学到了大概。把两个页面并排放在一起,差距还是能看出来。要我直接拿去上线,我肯定不会;拿它当第一版,我觉得够了。 以前脑子里有个页面的样子,最麻烦的是说不清。你跟开发说想要“有点设计感”“交互顺一点”,讲了半天,对方可能还是不知道你想要什么。自己不会写代码的话,很多想法就一直停在收藏夹里。 现在简单多了。先找一个接近自己想法的网站,录一小段,让模型搭出来。哪里不对,直接看着页面改。它没有把阿哲的网站原样搬过来,但它把一张白纸直接做到了七成。 所以这次测完,我还挺愿意安利 Ling-3.0-flash-VL。离专业前端当然还有距离,但对没代码基础、想做个人网站或者产品 Demo 的人来说,先把第一版弄出来,已经能省不少事了。 感兴趣的都可以去试一试:chat.ant-ling.com/chat
Today, we are releasing Ling-3.0-flash-VL, built on Ling-3.0-flash with visual understanding and visual agent capabilities. It performs well across visual perception, STEM reasoning, document intelligence, multimodal agent tasks, frontend coding, and medical report interpretation.
Paid partnership (ad)
184
102
122
37,401
Ella Tech & Tool retweeted
无敌了,我用 30 分钟,做了个给小孩订正作业的小工具。 现在这种视觉模型,已经开始够快、够便宜,可以直接拿来干活了。 我把孩子做完的作业丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 我没让它直接处理图片,我让它先让它看整张作业,把错题、题目区域、手写答案的位置直接输出成坐标。 后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的题。 这就比单纯 OCR 有意思多了。 🔥当然,现在还远没到“干死作业 App”。 它坐标可能有偏差。 但以前这种东西,你得自己接 OCR、版面分析、错题识别,甚至训练专用模型。 现在一个通用视觉模型,30 分钟就能先把整条链路跑通。 这里也有个很容易误解的地方: 视觉模型,不等于出图模型。 Ling 这种 VLM 的视觉,是它能看图片、截图、文档、视频。 它本身不是 Image 2.5 那种负责生成像素的模型。 它擅长看懂以后,把结果变成文字、坐标、代码或者动作,然后继续干活。 Ling-3.0-flash-VL 总参数 124B,但 MoE 每 token 只激活约 5.5B。 这对 Visual Agent 很重要,极为广阔的知识,以及极低的激活,能做到又快又好。 🔥再往前一步,这种模型甚至很适合当教师模型。 先让 Ling-3.0-flash-VL 批量看作业,生成错题框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小、更快的专用模型。 先让大模型直接干活,再让大模型教小模型干活。 这个 Demo已经完全跑通了,30 分钟能做到这一步,已经无敌了。 OpenRouter现在可以免费使用Ling-3.0-flash-VL: openrouter.ai/inclusionai/li…
155
142
449
91,749
Ella Tech & Tool retweeted
兄弟们,闲鱼日入过千的焚诀公开给你们! 昨天晚上发现一个闲鱼卖家偷懒神器。 就是蚂蚁百灵刚出的 Ling-3.0-flash-VL,你只要把淘宝订单截图丢进去,它自动提取商品名、原价、购买时间,再让它按六折写一段闲鱼文案,直接出成品。
139
83
247
70,261
Ella Tech & Tool retweeted
我直接扔给 Ling-3.0-flash-VL 一张设计稿图片,让它生成完整的HTML、CSS和JS。 8.7秒思考后它就在疯狂的吐代码,最后我把他生成的代码分别保存成 index.html, style.css, script.js 然后我在浏览器里打开了index.html,看到下面这样的效果。 可以看到,整体风格和版面保持的还是很好的,但是跟原稿也是有一定的差异。
125
67
65
9,313
This is seriously 🔥🔥 AI video is getting next level! Now I want to make one with Seedance 2.5 👀⚽️
" DOJA " by Haaland ⚽️🇳🇴 Want to make one? You can claim your free Seedance2.5 credits ⬇️ #wizstar #seedance #doja #haaland #centralcee
29
14
199
10,814
Ella Tech & Tool retweeted
一张截图,已经开始能直接变成网页、小程序和作品集了! 我拿 Ling-3.0-flash-VL 连测了 3 个真实场景: ① Apple 商店官网 不给源码,不给链接,只给截图。 一句 Prompt: 根据这张参考图,使用 HTML/CSS 尽可能高保真的复刻这个网页首屏 ② 蜜雪冰城小程序首页 Banner、IP、会员卡、功能入口、活动卡片、底部导航都在,它把主要结构和视觉层级搭出来了。 ③ AI 创意作品集 我拿婚纱摄影作品集做参考,让它直接改造成: AI 海报 / AI 插画 / AI 漫剧 / AI 广告视觉 让我意外的是,点击作品集图片后,出现了由模型自动生成的对应作品集介绍,没想到居然会有动态交互效果! 这套工作流最实用的地方就是: 找参考 → 生成第一版 → 看效果 → 截图反馈 → 局部修复 个人主页、作品集、小店官网、活动页、SaaS Landing Page,都能这么起步。 真正有用的多模态,是看懂之后还能继续生成、修改、执行,把活儿真正干下去。
Paid partnership (ad)
162
77
87
10,467
Ella Tech & Tool retweeted
谁懂啊!看密密麻麻的北京地铁图, 脑子直接开始乱换乘😵💫 只给地标、不提供地铁站名,AI 能不能带我坐对地铁? 今天实测 Ling‑3.0‑flash‑VL 多模态大模型🚇 ✅输入:整张北京轨道交通图 + 地标资料 ✅出发:王府半岛酒店 ✅打卡点位:前门大街|地坛古树|天坛祈年殿 ✅终点:北京南站 硬性考题两道: 1️⃣只用地标,自行识别对应地铁站、输出完整行程,写清每一段乘车与换乘 2️⃣把三个景点调换游览顺序,重新规划,看看能不能减少换乘次数 把满是线路的地铁图,转化成普通人直接照抄就能走的出行方案 📋 完整实操看视频👇 实测效果超出预期,真正体现视觉理解 + 视觉代理能力。 Ling‑3.0‑flash‑VL 在视觉感知、STEM 推理、文档智能、多模态代理任务、前端编码、医疗报告解读等场景都有不错表现。 如果你想体验下可以点击 chat.ant-ling.com/chat #Ling #AI工具 #北京旅行 #北京地铁 #多模态大模型
138
78
93
11,840
Ella Tech & Tool retweeted
伙伴们在尝试让 AI 改网页的时候,有没有在这一步卡住: “把按钮挪到标题下面,去把这块删掉,还要旁边那张卡突出一点。” 看着页面觉得很清楚,但是写成文字,却得去解释到底是去搞哪个按钮、哪张卡。能不能直接在截图上圈出来,让 AI 照着改? 我用 @AntLingAGI Ling-3.0-flash-VL 做了个小测试。准备了一张活动报名页,同时把源码和标注截图一起交给它: 红圈里的横幅删掉,按钮移到蓝箭头指向的位置,黄框里的票种设为唯一推荐项。 同一个任务测了三次,三次首版都把按钮放错了。 接着,我把前两次实际渲染出来的页面截图回传给它,让它继续修改。两次都在一轮反馈后通过了全部 17 项验收。第三次停在首版,保留为失败;这组最终完成了 2/3。 这里模型负责看图、修改代码,本地工具负责运行页面、截图和验收。 如果你也在用 AI 改落地页、活动页,这次测试有个值得试的方法: 先在截图上标明要改哪里;首版不对,就把实际页面再截给它看,指出没完成的地方。修改前也写清哪些内容要保留,避免挪好了按钮,却改掉价格或弄坏交互。 这也是我为什么设了 17 项检查:除了位置和推荐卡,还要核对原有文字,点开、关闭报名弹窗,展开 FAQ,再看手机端有没有遮挡、溢出和控制台报错。页面看着改好了,还得点一遍才知道能不能用。 不过,换个目标,它仍然会出错。我把黄框改到“观察席”,它却继续推荐“共创席”。这个变体只测了一次,失败了。 所以,在这组样本里,我看到了模型收到页面截图后修正代码的效果;但换一个位置、换一张卡,仍然需要重新检查。还不能把整页修改放心交给它后就不管了。 57 秒视频里放了标注输入、反馈后的变化、成功和失败结果,标注为已生成结果回放。 你可以照这个过程试自己的页面,也能看到哪些地方需要留给人验收。 - 蚂蚁数科国际站 :computrix.ai/sg/models/model… - 蚂蚁数科 maas 国内站:maas.antdigital.com/models/m… - Ling studio:chat.ant-ling.com/chat 这几个都可以,目前可用的体验地址
194
98
91
15,801