阿里巴巴发布了 Qwen Image 3.0,图像生成模型系列的第三代。如果说 1.0 的关键词是"准",2.0 是"准、多、齐、美、真",3.0 只给了一个字——"实"。
这个"实"体现在三个维度:
- 内容丰实:支持最大 4.5k token 输入,轻松生成报纸、分镜、试卷等复杂版面。
- 细节真实:支持 10px 小字精准渲染,毛孔、发丝细节生动还原,逼真的微观级刻画。
- 知识厚实:支持 12 国语言原生渲染,主流网页、游戏、直播等界面仿真,丰富的世界知识。

官方给了一个很直观的演示。
一张图,九个格子。每个格子分别描述不同的内容:隧道安全漫画、空间几何教学、出师表文体分析、物理抛体运动、寄生虫科普、医学图解、群论 Sylow 定理、银行内控信息图、细胞 DNA 结构对比。每个格子都有精确的中英文文字、公式、图表和漫画人物。

整张图是一次性生成的,不是拼接。描述这九个格子的提示词足足用了 3700 个 token。
3.0 把可接受的指令长度提到了 4.5k token。这意味着什么?复杂信息图的排版不再需要分块生成再手动拼合。报纸、试卷、分镜头脚本——这些真实世界的高密度排版,模型可以直接吞下去再吐出来。
团队管这叫"内容丰实",分两个维度:横展和纵深。横展是同一画布上能放多少并列元素——九宫格就是极限测试。纵深则是语义嵌套的能力——他们用一个例子展示了 VSCode 界面里开着 Qwen 聊天窗口,聊天窗口里嵌着微信界面,微信里又有一张咖啡海报。"画中画中画",四层穿透,每一层 UI 风格不乱。

第二个维度是"细节真实"。10px 字号下的文字可以辨读。学术论文里的 LaTeX 公式——上下标、希腊字母、定理编号——不会乱码。报纸字体、手写批注的笔触风格可以还原。人像的毛孔和发丝能拉到摄影级。


第三个维度是"知识厚实"。12 种语言原生渲染,100 多种艺术风格,主流网页和游戏 UI 仿真。模型还能联网获取最新的世界知识——官方例子是生成一张杭州当天的天气预报图。也可以根据特定 IP 形象创作,比如让齐白石和梵高在直播间介绍 Qwen Image 3.0。

编辑能力也没落下。传统绘画修复——去掉霉斑和破损,补全缺失部分,保持原画笔触。图像细节编辑——叠加红色批注、下划线、波浪线,模拟高中生笔记风格。
从 1.0 到 3.0 的进化路径很清楚:图像生成正在从"能不能画对"走向"能不能直接出活儿"。对于需要批量生产内容的人——设计师、教育工作者、电商运营——这个方向比刷榜更有意义。
参考来源: