Daily Tech Briefing
AI 科技速览
每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。
InfoQ AI · 2026/7/22 17:42:33

阿里千问发布 Qwen-Image-3.0,文本输入长度提升4.5倍
AI 中文解读
阿里千问最新发布的图像生成模型Qwen-Image-3.0,最引人注目的是它一口气能处理长达4.5倍于前代的文本输入——这意味着你可以用几百字详细描述一张图里的每个细节,而不用担心指令太复杂AI“听不懂”。
以前让AI画图,得把需求压缩成一两句简短提示,否则它容易遗漏或跑偏。现在你甚至可以给它写一段“剧本”:比如“生成一张九宫格知识图解,左上角放一个VS Code编程界面,中间嵌入千问App聊天窗口,右下角加一张手冲咖啡海报,所有界面保留截图时间和小字体文字”——它真能一次画出来,连小字都清晰可见。这个模型还支持12种语言和20多种字体的原生渲染,画数学试卷的公式、几何图形,或者多语言海报都不在话下。更妙的是,它把生成和编辑功能合二为一:第一张图不满意,可以直接在同个模型里局部修改、扩展场景或换风格,省去在不同工具间来回倒腾的麻烦。
对于普通人来说,这意味着以后做PPT、出试卷、设计产品海报、甚至制作影视分镜头脚本,都可以用自然语言一口气描述清楚,AI直接输出成品,大幅减少手动调整的工作量。学生用它生成学习图解,设计师用它快速出创意初稿,老师也能轻松制作带公式和步骤图的试卷。目前API已开放邀测,千问App和Qwen Studio也即将上线体验功能,这项能力离我们并不遥远。
7 月 21 日,阿里发布图像生成基础模型 Qwen-Image-3.0。新模型支持最高 4.5K Token 文本输入,可根据较长提示词生成包含公式、几何图形、逻辑推导步骤等内容的知识图解和复杂 UI 界面,并支持 12 种语言及 20 多种字体的原生渲染。Qwen-Image-3.0 是千问图像生成与编辑模型系列的第三代基础模型。阿里表示,新版本重点提升了复杂指令理解、文字渲染、空间布局以及多层信息组织能力,可用于人像摄影、数学试卷、网页界面、产品海报、影视分镜和古籍图像等场景。与前代模型相比,Qwen-Image-3.0 可处理的文本输入长度提升至原来的 4.5 倍。在影视分镜、复杂信息图和产品说明页等场景中,用户可以通过较长提示词描述画面结构、文字内容、视觉风格和排版要求,而不必将需求压缩为简短指令。阿里称,这一能力有助于减少多轮生成和后续人工调整。在复杂信息组织方面,Qwen-Image-3.0 可在同一张图片中组合不同类型的视觉元素。例如,模型可以根据一条指令生成由多个领域内容组成的九宫格知识图解,也可以在同一画面中嵌套网页、软件界面、聊天窗口和海报等内容。 比如,用户要求模型生成一张包含 VS Code 编程界面、千问 App、聊天窗口和手冲咖啡海报的多层嵌套图片。生成结果按照指令呈现了不同界面层级,并保留了截图时间、界面文字等较小尺寸文本。不过,相关效果目前主要来自企业展示,实际稳定性和不同场景下的生成质量仍需进一步测试。Qwen-Image-3.0 采用图像生成与编辑一体化架构,将文字渲染、图像细节和知识理解能力同时用于生成和编辑任务。据介绍,该模型可处理古画修复、全景图扩展、手绘草图转演示文稿、多镜头视角生成等任务,也支持局部修改、内容扩展和风格转换。一体化架构意味着用户可以在同一模型中连续完成初次生成和后续修改,不必在多个工具之间切换。其实际价值主要在于减少二次编辑过程中可能出现的文字变化、风格不一致和结构偏移。目前,阿里云百炼和千问 AI 平台已经开放 Qwen-Image-3.0 API 邀测。Qwen Studio 和千问 App 也计划上线相关体验功能。
分享
阅读原文 ↗