文婷 发自 凹非寺

  量子位 | 公众号 QbitAI

  千问说它可以帮我拼九宫格了,还是不同主题的那种。

  这两天,阿里推出了一款AI生图新模型——Qwen-Image-3.0。

  按官方说法,它不仅能准确生成仿真UI界面,还能帮老师一键生成排版精良的期末试卷;设计师也能用它快速输出海报、分镜和网页原型,省去从空白画布一点点搭框架的时间。

  更夸张的是,它还能在单张图中同时呈现9份不同主题的知识图解,并自动完成整齐排布,让信息密度和美观度同时在线。

  这次,Qwen-Image-3.0给自己的关键词只有一个字:实。

  不是单纯更好看,也不是只卷画风、构图、光影。

  而是要让AI画图不再停留在“哇,好漂亮”的惊叹,而是继续往前走一步:这图能不能装下我的所有需求、能不能把细节画清楚、能不能直接拿去改、拿去用、拿去交差。

  官方把这个“实”拆成三层:

  第一层是细节真实:它支持10px小字精准渲染,笔画笔锋、人物毛孔、发丝、纸张、批注这类细节都能稳住。

  第二层是内容丰实:Qwen-Image-3.0最长支持4.5k token输入,可以生成报纸、分镜、试卷、PPT这类复杂版面。

  第三层是知识厚实:它支持12国语言原生渲染,还能生成网页、游戏、直播等常见UI界面,甚至能结合世界知识做科普海报。

  外网也已经有人上手测了,在这份测评中,Qwen-Image-3.0的图像理解和代码生成表现,已经超过了GPT Image 2、Nano Banana 2等海外模型。

  听起来很猛。

  但图像模型的发布样例,向来有一个老问题,即“官方demo通常展示的,都是最顺的那一面。”

  真正到了编辑、教育、电商、设计这些场景里,到底好不好用,不能只看宣传页怎么写,也不能只看生成图第一眼漂不漂亮,还得上手测。

  所以,在收获一片掌声的同时,推上也出现了不少对Qwen-Image-3.0的吐槽。

  有人说它“速度慢”,有人吐槽它会“混淆术语”、“不懂语法”,甚至还有网友直接指出,官网封面图里的阿拉伯语语法就有问题:

  所以这次,我们围绕着官方信息提出的“内容丰实”、“细节真实”、“知识厚实”三个方向,设计了9道更具体的实测题,把额度测了个精光。

  就看它到底能不能装、能不能稳、能不能细、能不能懂。

  以及最关键的:它能不能真的帮我们干活交差。

  先看它细节真不真实,放大后会不会露馅

  噔噔噔噔,开场就丢王炸:验细节!

  先拿最不讲道理、也最容易露馅的学术论文页开刀。

  论文页看着朴素,实际上全是生图模型的雷区:密密麻麻的小字、上下标、希腊字母、分数线、多行公式推导……

  远看像论文不算数,放大后还能清清楚楚、不糊不乱,才算真本事。

  Qwen-Image-3.0能不能扛住呢?

  实测一:学术论文公式页

  提示词:

  效果如下(用时大约3分20秒):

  排版工整、字迹清晰,不错不错

  ,扛住了。

  出于好奇,在等待Qwen-Image-3.0生成图片的间隙中,我还用同一套提示词模版测试了一下ChatGPT Plus版的生成效果,结果如下(用时约1分19秒):

  △大家可以自行参考对比一下

  实测二:萌宠与主人的近景肖像

  测完了论文,让我们来看一张治愈感满满的《主人与猫》吧。

  提示词:

  成片

  :

  很好,我很满意~

  人物皮肤纹理、发丝质感、服装材质、猫咪标配傲娇表情等统统在线,氛围感十足。

  就是生成速度慢了点。(用时约一分半)

  实测三:读书笔记

  众所周知,生成一张新图是一回事,在原有的图像上做精细编辑则是另一回事了。

  所以我们这次要测的是,Qwen-Image-3.0能否在不破坏原图结构的前提下,模仿高中生记课堂笔记的习惯,给鲁迅先生的《狂人日记》加上重点笔记。

  提示词:

  效果如下

  :

  在这个过程中,虽然出现了一处同音错字“叶”(应该是“页”),但整体来看,它著名段落抓得很准,没有魔改原文,批注也像手写,有真实的人类思考痕迹和红笔笔记,与纸张纹理的融合也比较融洽。

  最让人惊叹的是,它模拟并展现出了学生们从“看到‘吃人’一词的不解到分析出‘虚伪’本质”的真实思考过程。

  后续在对话中指出错误后,Qwen-Image-3.0马上就改好了。

  再看它能不能把复杂需求都装进图里

  细节能不能画好,只是第一关。

  很多生图模型并非不会画图,只是画面里的元素一多,排版就开始失控。

  针对这一痛点,Qwen-Image-3.0把输入长度拉到了4.5k token。

  第二关就让我们用一道最直观的九宫格题来验验它的实际承载能力和横向铺开能力吧。

  实测四:复杂的九宫格知识图解

  提示词如下:

  效果

  :

  表现不错,过关。

  实测五:一张高中数学模拟试卷

  接下来,让我们再测测Qwen-Image-3.0生成模拟试卷的能力

  :

  提示词:

  生成一张真实打印感的高中数学模拟试卷,A4竖版,中文排版。

  顶部包含学校名称、考试名称、姓名和准考证号填写栏。

  第一部分为6道选择题,每题有A、B、C、D四个选项。

  第二部分为4道填空题。

  第三部分为3道解答题,其中包含一道带坐标轴和抛物线示意图的解析几何题,以及一道立体几何题。

  页面底部留出规范答题区域和横线。

  试卷应像真实教辅资料,题号连续、版面规整、公式清晰、图文不重叠。

  OMG,翻车的一幕出现了…….第一次生成的效果并不理想

  :

  我勒个去,怎会如此?

  难道测到一半就要翻车了吗?刺激!

  考虑到可能是因为我没有在提示词内要求“具体题目”和“北京地区”,所以我进一步补充了具体要求,并请Qwen-Image-3.0帮我生成一份有具体题目的北京高考试卷。

  不过很遗憾,它这次竟然直接放弃了生图,但给了我一套标准的试卷题目,并在结尾标明了该套试卷的难度系数和题目设置的合理性,让我自行排版:

  不过亲爱的Qwen-Image-3.0,我怎么可能乖乖就范?!不然还测你干嘛?

  于是下一步,情绪稳定的我将它给的试题整理到了文档中,并再次试图请求它据此生成一套试卷:

  很可惜,均不成功,而且这次它问题更大了。

  它不只是无法生成一套完整的试卷,它还在未告知我的情况下私自篡改了题目顺序,并偷摸吞掉了我设计的其他9道题目(包括2道选择题、2道填空题、5道解答题):

  △WTF???

  啥情况……难道它牛吹大了?还是我的方法出了问题?

  我突然反应过来,会不会不是模型不行,而是我一开始就没用对它的打开方式?

  前两次我都是习惯性地让Codex帮我写提示词,再丢给Qwen-Image-3.0生图。

  问题会不会就出在这里,Qwen-Image-3.0其实更吃自家模型生成的提示词?

  既然如此,那就试试看吧!来都来了!!!

  秉持着绝不轻易放弃的精神,我进行了第三次尝试:先用千问重新生成一套提示词,再交给Qwen-Image-3.0生图。

  还好,这次成功了!而且效果不错,很像我高三每周模拟考的试卷:

  这也让我发现,问题不在于模型本身,也不在于提示词要表达的内容,而在于“适配”。

  如果你也想让Qwen-Image-3.0帮你生成一份试卷,那你最好按这三步去操作(当然如果大家有更好的办法,也欢迎在评论区分享呀!):

  第一步,先把题库发给千问,让它基于这套题库生成一份适配Qwen-Image-3.0的专用提示词。(如果手头没有现成题库,也可以直接把出题要求告诉它,让它先生成题库。)

  第二步,复制千问给出的Markdown提示词模板;

  第三步,把Word题库和这份Markdown提示词一起发给Qwen-Image-3.0,这样才能生成我们想要的试卷版面。

  △这个提示词模板需要你根据每次的具体情况主动询问并获得。

  △千问新给的提示词几乎占了两页

  这一波三折的,确实很抓马。

  但它也深刻地提醒了我们一件事:用模型,最好还是要用对“钥匙”,别把A模型生成的提示词,原封不动地搬到B模型里用。

  毕竟提示词这东西,也有模型自己的脾气。

  这次我已经把踩过的坑连泥带土刨出来给大家看了,愿各位绕着走,别再沾一身灰啦~T T

  实测六:一条提示词,生成完整视觉初稿

  这一项主要测的是Qwen-Image-3.0能不能帮助设计师们从0开始完成质量较高的草稿设计。

  具体做法是,给它一个真实设计的brief,让它一次性生成“一张发布会海报、一组短视频分镜、一个移动端活动页原型”这三类常见的设计草稿,并观察它能否将三种不同的视觉任务规整地放进同一张图里,方便设计师参考,而不是一片混乱。

  如果这一项过了,才能说明它真的有能力帮设计师先跑一版,而不是只会生成一张孤立的漂亮图。

  以下是Qwen3.7-Plus生成的提示词(全文测试均基于此版本):

  成果展示

  :

  △请各位品鉴效果,欢迎在评论区畅所欲言。知识厚实:看它的认知能否跟上现实、是否真的懂场景

  如果说前两关考验的是“Qwen-Image-3.0到底能不能装、能不能稳、能不能细”,那么最后一关则考验的是它“到底能不能懂”。

  这应该是图像生成最难的部分,因为模型必须要拥有海量的认知、要真的了解现实世界的最新变化和各类规则。

  实测七:日文美妆直播间

  这是一道集语言、规则和产品知识于一体的综合题。

  Qwen-Image-3.0不仅要写对日文,还要知道日本直播电商界面里,主播画面、弹幕、商品卡、折扣、下单按钮通常如何分布,有何特点。

  提示词为:

  这题的标准是不能只“有日文”,还想让熟悉日本产品的人一眼看过去也不会觉得别扭。

  让我们一起来看看实测效果

  :

  大家觉得咋样?

  (注:日元JPY和人民币CNY的货币符号写法基本相同,均为“¥”,只是国际上通常会加上国家代码加以区分,例如JPY¥或CNY¥。)

  实测八:多语种杭州夏日旅游海报

  接着,让我们来设计一张多语种商业旅游海报吧。

  我们需要让中文、英文、日文同时出现在一张商业海报物料上,且标题、时间、地址、图片一个都不能少,更重要的一点是不能有错字,因为只要有一个错字,整张设计稿都将回炉重造了。

  提示词如下:

  效果

  :

  太漂亮了,我将立即逃离工位出发杭州

  (bushi)。

  实测九:仿一个量子位公众号界面

  最后,让我们来整个活,顺便测试一下Qwen-Image-3.0设计仿真UI界面的能力吧~

  这一次,我将指示Qwen-Image-3.0生成一张“手机端量子位公众号文章页”仿真图。

  它画图时要同时做到三件事:

  第一,像一个手机端真实微信文章页面,有顶部导航、账号信息、标题区、首图和互动按钮

  第二,能自然露出量子位的账号信息和科技媒体调性;

  第三,还能把Qwen-Image-3.0这篇实测文章包装成一条足够想点开的推送。

  当然,作为整活环节,我还要偷偷加一个小彩蛋:主编微信消息弹窗,夸我写得真棒。(doge)

  提示词:

  非常期待,让我们一起来看看效果

  :

  △左边是AI生成,右边是真实公众号文章页面

  哎呀,看到夸奖和10w+我好高兴哈哈哈哈哈(梦里什么都有,但现实什么时候能眷顾我一下)。

  而且很惊喜的是,它生成的这张图片连手机界面的时间、信号、电量等细节都有!

  但客观来说吧,它生成的格式和现实里的微信文章页确实不太一样。

  整体感觉像是把小红书、微信公众号、知乎等几个平台的界面风格揉在了一起,最后画出来一个有点“混血”的页面。

  不过,至少它没有只生成一个泛泛的手机界面。Logo、账号信息、发布时间、转赞评互动区、浏览量数据这些元素都在,摘要、小标题等文章基本结构也基本具备。

  这说明它对具体UI场景已经有了一定理解,只是还需要像修错字一样,多沟通、多指令、多调几轮。

  哦,你问我这次为什么不继续调?前面文章里的错字、试卷我都一轮轮改了。

  求苍天辨忠奸……不是我不想测,恰恰相反,是我测得太认真,把额度测光了啊啊啊!!

  △真没了。它能让我把9道题完整测完再触发limit,我已经很心怀感激了。

  不过话说回来,如果一个模型仍然需要用户反复烧额度,才能把图调到想要的样子,也说明它距离“一把出活”还有不少改进空间。

  大家感兴趣的话,欢迎把自己调好的版本发到评论区哦。

  答对无奖!

  “你很出色,但确实还有一些不足的地方。”

  这9道题测完,相信大家对Qwen-Image-3.0的能力已经有了一个比较直观的认识。

  正如评论区这位俄罗斯网友说的:Qwen-Image-3.0是很出色,但它确实还有一些不足的地方。

  相比于之前的Qwen-Image-1.0和2.0,这一代在“细节真实”、“内容丰实”和“知识厚实”三个方向上,进步是明显的。

  但它距离“让用户放心拿来干活”,还有需要补课的地方。

  有的是速度问题,有的是准确度问题,也有的是复杂场景里的稳定性问题。

  比如这位用户在使用Qwen-Image-3.0生成一张西班牙语学术九宫格图时,就遇到了“同音术语混淆”、“拼写错误”、“格式不规范”等问题。

  但与此同时,她也坦诚地表示,Qwen-Image-3.0在西班牙语文本质量上的进步让她印象深刻,并向Qwen表达了感谢。

  这也说明,Qwen-Image-3.0确实让人惊艳、也确实已经能把很多复杂任务做起来,但要真正做到稳定、准确、快速、一把出活,还得继续打磨。

  毕竟,没有人希望自己在赶着交差时,交上去的是一张带着错误的图片。

  希望Qwen-Image系列后续能持续关注这些真实的用户反馈,并在下一代模型里把这些坑补上吧。