新模型 2026-09-04

蚂蚁百灵发布 Ling-3.0-flash-VL:会看图的 AI,能读报告还能写前端

蚂蚁百灵发布 Ling-3.0-flash-VL:会看图的 AI,能读报告还能写前端

一句话说清:蚂蚁集团旗下的百灵大模型,9 月 4 日发布了新版本 Ling-3.0-flash-VL——以前它只能处理文字,现在「睁开了眼睛」:能看图、读文档、读医学报告,甚至给你一张网页设计图,它直接写出前端代码。

发生了什么

  • 9 月 4 日 18:04,蚂蚁百灵团队发布 Ling-3.0-flash-VL,在原有文本模型 Ling-3.0-flash 基础上加入视觉理解和视觉 Agent能力(VL = Vision-Language,视觉语言)。
  • 官方公布的六大能力方向:
  1. 视觉感知:识别图像里的物体、场景、关系;
  2. STEM 推理:处理数学、物理等图文题;
  3. 文档智能:读懂表格、图表、扫描件等复杂文档;
  4. 多模态 Agent 任务:结合画面执行多步操作;
  5. 前端编码:看设计图/界面截图,直接生成对应代码;
  6. 医学报告解读:辅助理解医学影像和报告。
  • 它不是从零训练的多模态模型,而是在文本模型上「叠加」视觉通道,所以文本能力保留,调用也更省事。
  • 目前官方只公布了能力方向,未给出具体评测数据或开源计划。

来源:网易「字节漫游指南」(2026-09-05)、AGI Hunt(2026-09-04/05)报道。

对我有什么用

  • 多模态大模型正在从「能看图」走向「会做事」——模型不只是描述图片,而是基于看到的内容做决策、执行动作(Agent)。
  • 对国内用户而言,这是又一家大厂把「视觉 + 办公 + 代码」合一的实用模型推到台前,和海外 GPT-6 Astra、Gemini 3.8 Flash 等在同一赛道竞速。

我可以怎么做

  1. 读复杂文档:拍一张表格、合同扫描件、PPT 截图,让它帮你提取关键条款、整理成清单。
  2. 设计图变网页:给一张网页/界面设计稿,让它生成前端代码(HTML/CSS/JS),不懂代码也能先有个能跑的雏形,再让开发者改。
  3. 看医学报告:上传检查单/报告图片,让它用大白话解读指标含义(仅供参考,不能替代医生)。
  4. 解题:把数理化题目拍下来,让它一步步推理讲解。
  5. 关注蚂蚁百灵/百宝箱等官方入口,等模型开放 API 或体验通道后直接试用。

温馨提醒

  • 医学/合同类内容务必复核:AI 解读可能出错,涉及健康、法律、财务,一定要找专业人士确认,别直接照做。
  • 未开源、未公布评测:当前是能力宣发,实际效果以你亲手试为准,别被宣传口径带偏。
  • 上传图片时注意别传身份证、病历、公司机密等敏感信息。
  • 生成的前端代码需人工检查再上线,避免安全漏洞。
📤 一键转发小助手 帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发