通义千问开源 Qwen-Image-2.1:7B 小模型,文生图 + 透明图 + 重编辑全合一
阿里通义千问开源了 Qwen-Image-2.1。一句话概括它的定位:把生成效果、推理效率和成本压到同一个平衡点——视觉生成部分只有 7B 参数,却把文生图、透明图生成和图像编辑整合进了同一个模型,还原生支持透明图像的生成与编辑。 几个值得拆开的点。第一个是"小模强效"——视觉生成部分用 32 层 Single-Stream DiT,7B 参数。省参不代表省脑子,把一个原本要几十 B 干的事压到 7B,靠的是针对推理效率的结构优化:模型对文本和图像采用不同的处理策略,文本(系统前缀、编辑指令)走 Token 级因果掩码,图像生...

