Digital Artist | AI Visuals | Original concepts | Open for collabs @higgsfield, @Flovaai, @itsPolloAI, @nadou_pro, |📧zyrella093@gmail.com

Pinned Tweet
Clarity in visual storytelling is not about making everything plain. It is about knowing what the viewer should notice first. l used this 15-second piece as a small test. The opening has paper textures, hanging greenery, and plenty of empty space, but the message still needs to land immediately I made it with Pexo with one question in mind:does every element help the idea, or is it just taking up attention? Simple-looking frames usually involve more decisions than people think. @Pexoai_offical You can try it here:invite.pexo.ai/4Ax6Brk
Paid partnership (ad)
42
3
98
7,635
Trollface walks into a Pepe convention. What happens next is pure internet cinema. This tutorial shows how to turn meme characters and scene references into a synchronized AI video with FlovaAI. #FlovaAI #AITutorial
Paid partnership (ad)
38
4
138
11,377
Mainland China iPhones may miss Apple Intelligence, but that doesn’t mean you’re stuck. I built my own “Visual Siri” using iOS Shortcuts, OpenRouter, and Ling-3.0-Flash-VL. Take a photo → AI understands what’s in it → get a Chinese summary, key points, potential risks, and useful suggestions. Next: screenshot analysis, follow-up conversations, and voice control.
国区 iPhone 没有 Apple Intelligence / Siri AI?那就自己接一个。 我用 iOS 快捷指令 + OpenRouter,把 Ling 3.0 Flash VL 接进了 iPhone。 现在直接拍一张图,就可以交给视觉模型识别、理解并返回结果。视频里随手拍了一页 NVIDIA 的新闻稿,几秒后就能得到中文摘要、关键信息、风险点和建议。 相当于给国区 iPhone 手搓了一个自己的「视觉 Siri」👀 后面准备继续加:截图识别、上下文追问、语音唤起。 OpenRouter现在可以免费使用Ling-3.0-flash-VL: openrouter.ai/inclusionai/li… #AI #iPhone #AppleIntelligence #Ling3
Paid partnership (ad)
27
1
79
4,450
Going viral isn’t simply about posting more. It’s about knowing when to create and how to build momentum. When a campaign connects with the right audience, one idea can spark thousands of conversations and massive visibility. The numbers are only part of the story. The real impact is the attention, engagement, and momentum built along the way.
今天是在 𝕏 上和 Musk 抢热榜的一天 5 条热榜中,占了 3 条,同期共上了 4 次热榜,累计 22.5 K+ Posts,详情见下方 想让你的产品也上 𝕏 热榜吗?欢迎 DM
Paid partnership (ad)
50
1
123
2,976
Zyrella retweeted
今天是在 𝕏 上和 Musk 抢热榜的一天 5 条热榜中,占了 3 条,同期共上了 4 次热榜,累计 22.5 K+ Posts,详情见下方 想让你的产品也上 𝕏 热榜吗?欢迎 DM
116
81
129
42,653
Created this cinematic short with @vivago_ai using the Cinematic Story Director skill. From a drowned shipyard to a cracked pocket watch that opens a hidden cliff city. If you’re into AI filmmaking, join the Vivago Discord and try it yourself. #ai #vivago #aivideo #CinematicStoryDirector
Made with AI
Paid partnership (ad)
56
6
214
10,786
Zyrella retweeted
蚂蚁百灵昨天发了个多模态模型 Ling-3.0-flash-VL,我测试了一下它的"看图写代码"能力。 丢了一张网页设计图进去,让它直接输出完整 HTML + CSS。 从上传到渲染出页面,全程录屏👇
153
96
94
173,380
Zyrella retweeted
1/2) 最近看到一个有意思的技术趋势:大家又开始重新拥抱 Native 了。 Shopify 刚刚宣布,要把移动 App 从 React Native 重新迁回 Swift 和 Kotlin。 更夸张的是,在 Coding Agent 的帮助下,他们只用了 12 周,就把 Shop 从 概念验证做成了已经上架 App Store 的原生应用。 Shopify 给出的理由很直白: 以前选择跨平台,是因为“同一个功能写两遍”太贵。 Notion 其实更早就在走这条路。 它的移动端曾经大量依赖 WebView / React Native,后来为了启动速度、交互体验和系统级控制,一点点把核心界面迁到了原生。 现在也宣布,完全用原生方式重建 Notion 的移动端应用。 why? 因为现在 AI Coding 能力是越来越强,原生开发最大的成本劣势正在快速消失。 所以我最近 Vibe Coding 一个 AI 工具的时候,没有 Electron,没有网页套壳。 我直接就是做成了一个 macOS 原生的实时视觉 AI 助手。 它想解决的问题非常简单: 以前你想问 AI: “右上角那个按钮是什么意思?” “这个公式怎么推出来的?” “第三行这个数字占总数多少?” 你首先得花半天跟 AI 描述—— “我到底在看哪里。” 现在不用了。 在 Mac 上按下快捷键,直接在当前屏幕上: 截图 → 画圈 / 框选 / 箭头标记 → 提问。 AI 直接看懂你指的是哪里,然后秒级流式回答。 整个过程不用切 App,也不需要把截图保存下来,再拖进 ChatGPT。 看到哪里,问到哪里。 一个视觉 AI 助手如果每天要被唤起几十次,它就不应该像一个“网页工具”。 它应该像 Spotlight、截图工具一样,长在操作系统里。 而驱动这个助手的,是蚂蚁百灵刚刚开源的: Ling-3.0-flash-VL。 实际跑下来,我测试了几个特别适合这种 Native + Vision 交互的场景。 ━━━━━ ✨ 场景 1:看到外语,直接圈 碰到英文文档、论文、国外软件界面: 不用复制文字。 直接把屏幕上的区域圈出来,问: “这段是什么意思?” Ling-3.0-flash-VL 会同时利用视觉位置和文字内容进行理解,再把结果流式返回。 相当于给 Mac 加了一个随时可以召唤的视觉翻译层。 ━━━━━ ✨ 场景 2:看到公式,直接问 看论文时遇到复杂的微积分公式、上下标、符号关系: 直接框起来: “给我讲明白这个公式。” 它不仅要 OCR 出字符,还需要理解公式的结构。 实际测试里,它可以继续解释定理、变量含义、推导过程,再用大白话重新讲一遍。 以前是: 截图 → 保存 → 上传 → 描述问题。 现在就是:圈一下。 ━━━━━ ✨ 场景 3:看到数据,直接算 表格可能才是这个交互方式最爽的地方。 我直接用画圈和箭头标出表格里的一个商品,然后问它占比是多少。 它马上识别出我指的是“桃子”,再结合整张表里的数字完成计算: 桃子的销量占比:16.7%。 这里实际上连续做了三件事: 视觉定位 → 语义理解 → 数值计算。 而用户只做了一件事:圈。 ━━━━━ 但 Ling-3.0-flash-VL 真正让我感兴趣的,其实不只是“看图问答”。 它本身就是冲着 长程多模态 Agent 去设计的。 ⚙️ 124B 总参数,单 Token 仅激活 5.5B 采用稀疏 MoE 架构。也就是说,它不是靠把一个巨大的 124B Dense 模型每次完整跑一遍来工作,而是在每次推理时只激活其中一部分专家。 目标就是: 把大模型容量和实时推理效率同时保留下来。 ⚡ 视觉不是外挂,而是原生进入推理链 它原生支持图片、文字和视频。 ViT 负责视觉编码,再把视觉信息真正送进后面的理解、推理、行动与验证流程。 这点很重要。 因为未来的视觉 Agent,并不是: 看图 → 回答一句话。 而应该是: Observe → Act → Verify → Correct 看见界面 → 执行操作 → 再看结果 → 发现错误 → 自己修。 这才是 GUI Agent 真正需要的能力。 📚 256K 长上下文,面向复杂多模态任务 这意味着它不只是适合单张截图问答,也能一次处理更长的文本、更复杂的多图输入,以及持续时间更长的视觉信息。 同时,它还加入了 VideoRoPE 时空编码,让模型不仅能理解“画面里有什么”,还能够结合时间顺序去判断: 什么事情,在什么时候发生。 所以它可以进一步用于长视频理解、事件检索、片段定位,以及更复杂的多模态 Agent 工作流。 对我这个 Mac 原生助手来说,这一点也很重要: 未来它不一定只理解“你刚刚圈的这一块”,还可以结合前后的屏幕内容、历史操作和上下文,持续理解你正在做什么。 💻 对 Agent 和代码生成尤其友好 这也是为什么我觉得它特别适合这个 Mac 助手。 它不仅能够理解: ⭕ 圆圈 ➡️ 箭头 🟨 高亮 ▢ 框选 这些人为添加的视觉提示, 还可以直接: 看 UI → 理解布局 → 写 HTML / CSS / SVG → 再看生成结果。 如果再给 Agent 接一个 Image Diff: 生成页面 ↓ 截图 ↓ 和目标图对比 ↓ 发现偏移 ↓ 修改代码 ↓ 再次截图验证 就可以做出完整的: 「生成 → 看结果 → 对比 → 修改」视觉自愈闭环。 ━━━━━ 而且 Ling-3.0-flash-VL 最近又更新了两个非常关键的东西。 ① API 可以免费玩 Ling-3.0-flash-VL 现在已经上线 OpenRouter, 官方最新活动是:两周免费使用。 所以想复刻类似的视觉 Agent,基本可以直接拿 API 开始测试。 ② 模型已经开源,而且量化版本也补齐了 也就是说,你既可以直接调用 API, 也可以根据自己的硬件环境,选择不同精度版本自己部署。 这对本地视觉 Agent 尤其重要: 云端 API 是最快的起点,本地模型才是隐私和系统级 AI 的终局之一。 ━━━━━ 所以我越来越觉得: Shopify 从 React Native 回到 Swift/Kotlin,其实不只是一次技术栈轮回。 背后更大的变化是: AI 正在重新改写“原生开发到底贵不贵”这笔账。 以前: 跨平台 = 开发快。 原生 = 成本高,但体验好。 现在 Coding Agent 开始承担大量重复实现、迁移、测试和 Review 之后, 这个公式可能变成: AI Coding + Native = 开发效率 + 原生体验。 而视觉模型又给 Native App 增加了一层新的可能: 它不只是“一个带 AI 的应用”。 AI 可以开始直接理解你正在使用的整个操作系统。 以前是: 人费劲地告诉 AI:我在看什么。 以后可能只需要:划个圈。 它就懂了。 附录链接👇
前端哥Liam
157
95
106
26,834
这两天看到我一直很喜欢的设计师阿哲 @Formulasearch 的个人网站,我挺喜欢他个人主页的那个风格。 看着看着突然冒出一个念头: 这种个人审美很强的网站,模型光看录屏,能不能做出来? 于是我顺手录了 10 秒左右,从页面上划过去,直接把视频丢给 Ling-3.0-flash-VL,让它照着做一版。 没给源码,也没拆页面,更没写一大段提示词。输入就那段录屏,加上一句很简单的需求。其实扔进去的时候,我没抱多大期待。视频一晃就过去了,有些细节让我自己暂停看,也未必记得住。 Ling-3.0-flash-VL 是百灵在 Ling-3.0-flash 上加了视觉理解和 visual agent 的版本。官方提到的能力挺多,视觉感知、STEM、文档、前端编码、医疗报告都在里面。我这次没全测,就看一件事:它能不能看完一段网站录屏,真把页面做出来。 结果打开以后,我确实愣了一下。 按肉眼看,和阿哲的原版大概有七成像。大的版式、配色和页面感觉都抓到了,生成出来的也不只是一个摆着看的空壳。按钮能点,交互能跑,放进浏览器里,已经像个可以接着改的半成品。 当然,剩下那三成也挺明显。风格不够细腻,字体没那么贴,交互还是有点僵,一些细节只学到了大概。把两个页面并排放在一起,差距还是能看出来。要我直接拿去上线,我肯定不会;拿它当第一版,我觉得够了。 以前脑子里有个页面的样子,最麻烦的是说不清。你跟开发说想要“有点设计感”“交互顺一点”,讲了半天,对方可能还是不知道你想要什么。自己不会写代码的话,很多想法就一直停在收藏夹里。 现在简单多了。先找一个接近自己想法的网站,录一小段,让模型搭出来。哪里不对,直接看着页面改。它没有把阿哲的网站原样搬过来,但它把一张白纸直接做到了七成。 所以这次测完,我还挺愿意安利 Ling-3.0-flash-VL。离专业前端当然还有距离,但对没代码基础、想做个人网站或者产品 Demo 的人来说,先把第一版弄出来,已经能省不少事了。 感兴趣的都可以去试一试:chat.ant-ling.com/chat
Today, we are releasing Ling-3.0-flash-VL, built on Ling-3.0-flash with visual understanding and visual agent capabilities. It performs well across visual perception, STEM reasoning, document intelligence, multimodal agent tasks, frontend coding, and medical report interpretation.
Paid partnership (ad)
184
103
123
36,859
Zyrella retweeted
无敌了,我用 30 分钟,做了个给小孩订正作业的小工具。 现在这种视觉模型,已经开始够快、够便宜,可以直接拿来干活了。 我把孩子做完的作业丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 我没让它直接处理图片,我让它先让它看整张作业,把错题、题目区域、手写答案的位置直接输出成坐标。 后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的题。 这就比单纯 OCR 有意思多了。 🔥当然,现在还远没到“干死作业 App”。 它坐标可能有偏差。 但以前这种东西,你得自己接 OCR、版面分析、错题识别,甚至训练专用模型。 现在一个通用视觉模型,30 分钟就能先把整条链路跑通。 这里也有个很容易误解的地方: 视觉模型,不等于出图模型。 Ling 这种 VLM 的视觉,是它能看图片、截图、文档、视频。 它本身不是 Image 2.5 那种负责生成像素的模型。 它擅长看懂以后,把结果变成文字、坐标、代码或者动作,然后继续干活。 Ling-3.0-flash-VL 总参数 124B,但 MoE 每 token 只激活约 5.5B。 这对 Visual Agent 很重要,极为广阔的知识,以及极低的激活,能做到又快又好。 🔥再往前一步,这种模型甚至很适合当教师模型。 先让 Ling-3.0-flash-VL 批量看作业,生成错题框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小、更快的专用模型。 先让大模型直接干活,再让大模型教小模型干活。 这个 Demo已经完全跑通了,30 分钟能做到这一步,已经无敌了。 OpenRouter现在可以免费使用Ling-3.0-flash-VL: openrouter.ai/inclusionai/li…
155
142
449
91,101
Zyrella retweeted
兄弟们,闲鱼日入过千的焚诀公开给你们! 昨天晚上发现一个闲鱼卖家偷懒神器。 就是蚂蚁百灵刚出的 Ling-3.0-flash-VL,你只要把淘宝订单截图丢进去,它自动提取商品名、原价、购买时间,再让它按六折写一段闲鱼文案,直接出成品。
139
83
247
67,989
Zyrella retweeted
我直接扔给 Ling-3.0-flash-VL 一张设计稿图片,让它生成完整的HTML、CSS和JS。 8.7秒思考后它就在疯狂的吐代码,最后我把他生成的代码分别保存成 index.html, style.css, script.js 然后我在浏览器里打开了index.html,看到下面这样的效果。 可以看到,整体风格和版面保持的还是很好的,但是跟原稿也是有一定的差异。
125
67
67
8,693
Zyrella retweeted
大开眼界,跑完交易回测算法,我见识到了 Jev 交易决策的效率和质量,况且只是简单地跑了几个算法,77 天收益率高达 +6.71%。 跑完之后剩一个问题:这一堆 JSON 怎么给人看? 我把可视化设计稿丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL,让它照着写前端,最后输出视频。 我没给它设计稿标注,也没给它组件库。它自己看图,直接构建出动态仪表盘页面:净值曲线、三个策略的持仓条、当日决策流、右上角的加速倍数。然后它用 playwright 逐帧截图,390 帧压成 13 秒,浓缩了 95 天的新闻与行情。 说到具体的方法论:我把 NewsHub 攒了三个月的投资日报,一天一份丢给 OpenRouter 上的 Jev 1.13。我给它当天的日报和当前持仓,它能迅速输出每个标的买、卖还是不动,附带三个选项的概率和置信度。后面的程序拿着这些概率去调仓、按 Binance 真实小时级别 K 线成交、算净值、对账。 77 天,3 个策略(动量、逆向、宏观),5 个标的(BTC / ETH / SPY / QQQ / XAU),1155 个决策。全程只花了 $0.09(Ling-3.0-flash-VL目前在OpenRouter免费😺),跑完 87 秒,单次调用 1.1 秒,零次失败。 当然,现在还远没到干死基金经理的程度。动量策略 +6.71%,但同期等权买入持有是 +13.2%,它没跑赢。而另外两个策略表现比较拉胯,一个 −1.0%,一个 −10.3%。 🔥 Jev 和多模态 Ling-3.0-flash-VL,一个负责判断,一个负责看懂和展示。 Ling-3.0-flash-VL 总参数 124B,但 MoE 每 token 只激活约 5.5B。 这对 Visual Agent 很重要,极为广阔的知识,以及极低的激活,能做到又快又好。 OpenRouter现在可以免费使用Ling-3.0-flash-VL: openrouter.ai/inclusionai/li…
139
107
210
119,647
Zyrella retweeted
Ling-3.0-flash-VL 是蚂蚁百灵首个即将生成的多模态模型,它不是“文本模型后面再挂个视觉头”,而是从训练开始就把图、文、视频同一条推理链,总起来讲就是能看图、会看图。
Article

Ling-3.0-flash-VL 蚂蚁的又一个免费大模型 抓紧使用啊

今天看到一个很引人注目的AI工具,分享给大家——Ling-3.0-flash-VL。 目前现在仍然处于免费期内,https://openrouter.ai/chat 可以使用这个链接进入。@AntLingAGI 一、它是 Ling-3.0-flash-VL

170
114
128
22,140