{主关键词}

一 | 今天,7月21号。 阿里发布了它最强的图像模型,Qwen-Image-3.0,接下来,估计你会看到一大堆实测;发布会官方的关键词,就一个字:实;内容丰实、细节真实、知识厚实;三个词,阿里自己给的答案。 但我想退一步,先问一个问题:图像模型发展到今天,到底在比什么? 搞懂这个,比看一场花里胡哨的演示重要得多。 为什么这么说? 过去几年,你对AI生图的印象,大概还停在「画得像不像、美不美」这一层。手指头画对了没,光影真不真实,AI味重不重。 近日,在新余市分宜县亚林中心年珠实验林场,工作人员发现国家近危级珍稀植物——水晶兰。图源:“江西发布”微信公众号 水晶兰,这个名字如梦如幻,在生物界中也有着独特而神秘的地位。它是武侠小说“幽灵之花”的原型,其形酷似一株洁白无瑕的水晶,散发着诡异而迷人的光芒。水晶兰虽然分布广泛,但其个体数量在同一地区却极为很少,是名副其实的珍稀植物。 当天上午,年珠实验林场的工作人员在林区野外作业时,无意中发现路边生长着几株奇特植物,植物高10至15厘米,为白色半透明鳞片,花朵微微下垂。后经辨认,该植物为水晶兰。 这套比赛规则里,图像模型是个画师,考画功。 据了解,水晶兰虽然名字带“兰”却不是兰花,而属于鹿蹄草科植物。多年生,草本,腐生;茎直立,单一,不分枝,高10厘米至30厘米,全株无叶绿素,白色,肉质,干后变黑褐色。水晶兰八九月份开花,主要分布于俄罗斯、日本、印度、东南亚、北美等国家及地区;在我国主要分布于山西、云南、四川、贵州、广西等省份。 水晶兰对海拔、气候、土壤等生长环境尤为苛刻,分布在中高海拔的针阔混交林和阔叶林下,大多生长在海拔800米至3200米的幽暗潮湿的环境里,只有在人迹罕至、阳光稀缺、生态环境非常好且落叶重重的深山丛林里才有机会见到,非常罕至。可这场发布会,阿里声称的所有升级,指向的都不是画功。 水晶兰经过千万年的进化,叶子已经蜕变成白色的鳞片,浑身晶莹剔透如水晶一般,没有一点叶绿素,无法进行光合作用,依靠腐烂的植物获得养分。因其特殊的腐生方式,水晶兰被称作“幽冥之花”,或称“梦兰花”“腐生花”等,是一种无毒植物。在武侠小说中,水晶兰被神化成能够起死回生的仙草,要么被视为具有灵异力量,可以无形中致人毙命的邪物,甚至将它的幽香也描写得令人毛骨悚然。其实水晶兰既没有回天的魔力,更不会伤人致命,而是一味性草味淡,可医治体虚久咳的民间良药。 水晶兰虽属多年生草本腐生植物,即其正常生命周期超过两年,但一年365天,有300多天都隐藏在地下,只有40多天露出地面,开花结果。如果碰到极端天气,或者受到环境影响,它们露出地面的时间还会更短。 是另一个指标:一张图里,能装下多少东西。 说一个最直观的数字。

二 | 提示词长度。水晶兰在2013年列入《中国生物多样性红色名录-高等植物卷》,属于近危物种。 水晶兰的种子异常微小,几乎没有任何营养物质,且根部完全寄生在其他植物的根上。上一代Qwen-Image-2.0,一次最多吃进去1K token的指令。3.0直接拉到了4.5K。翻了4.5倍。

三 | 这种生物特性使得水晶兰在普通的人工环境中很难存活。 “水晶兰对生长环境要求特别苛刻,这表明大岗山地区生态环境保护的效果很好,同时也对水晶兰的地域分布研究提供了参考。 这意味着什么? 过去你给图像模型下指令,只能压成一句话。现在你可以像给设计师写需求文档一样,把画面结构、文字内容、排版细节,完整地写进去。 发布会现场演示的一条提示词,3700个token,折合约13000个字符。”亚林中心年珠实验林场科技人员袁毅杰称。什么概念?一份小型说明书的体量。 这份说明书生成了什么? 一张九宫格。 (透视社综合央视新闻、云南网、大江网、贵州日报、大皖新闻、南宁晚报、“江西发布”微信公众号报道) 编辑:李煦、廖明娟(实习) 校对:李旭颖 审核:龚紫陌。九个格子,九个不同学科的知识图解。数学公式、几何图形、逻辑推导,各画各的,互不串门。一条指令,一次生成。

四 | 作为对照,现场把同一条提示词喂给了2.0;超出1K限度之后,模型就开始「胡字」,连九宫格的框都排错了位置。 另一组演示往纵深走,让模型生成一个VSCode编程界面,界面里打开着千问App,App的聊天窗口里躺着一张手冲咖啡海报。

五 | 三层界面套娃,每一层的结构和风格都要对,最里层海报上的文字还得清晰可辨。 官方演示里,手机截图上的时间数字,小到只有10个像素,现场还把一张YouTube界面图放大20倍来看,这些字小到只占原图的1%,字字可辨。 把这些演示摆在一起,动作是同一个: 往一张图里塞进更多的东西。更长的指令、更多的画面、更深的嵌套、更小的字;塞进去,还要保证每个字都是对的。 这就是「实」的人话版本:信息密度;图像模型比赛项目,正在从「画得好不好」,换成「装得下,装不下」。 ...... 问题来了:一张图塞这么满,给谁看?谁买单? 这就要算一笔账了,图像模型这门生意,主流模式简单到有点原始:按产出量。 我查了一下现在市面上的计费方式。国内厂商的图像API,普遍按张收费,生成一张收一张的钱。 OpenAI的GPT-Image-2按token计费,产出的图越多越大,token烧得越多。名目不同,骨架是同一副:客户为产出的量买单。

六 | 阿里的3.0目前还在公测申请阶段,没有定价;不过,记住「按量收钱」这四个字。我们再回头看发布会上一个不起眼的案例。 讲商业化的架构师举了短剧行业: 过去客户做一部短剧的前期素材,人设图、场景图、每个镜头的分镜图,要一张一张生成,几十张起步。现在这些元素可以融在一张图里,一次出完。 官方的原话:过去生成几十张图的事,今天一张搞定。 这笔账发布会没有算下去,我替它算完;按量计费的模式下,几十张变一张,客户这个环节的账单就压到了原来的几十分之一,单价一分没动,客户掏的钱少了一个数量级。 这不是短剧一个行业的特例。 讲到办公场景时,同一位架构师又算了一笔时间的账:过去自己调一个复杂的PPT页面,字号、字距、排版一处处抠,要半小时甚至一小时,用3.0生成,最快半分钟。 张数的账、时间的账,算的是同一件事:图的信息密度越高,客户为一份可用素材付出的成本就越低。 C端是同一个逻辑的零售版。 发布会上,千问App的产品经理举的例子是手帐和社媒封面;过去要找模板、挑图、拼字、调排版,做到一半就想放弃。

七 | 现在一句话丢给模型,文字、排版、贴图一次成型。 企业省账单,个人省那个熬夜拼图的晚上,这大概就是信息密度在商业上的真实身份:一种不打价格战的降价。 直接降单价是价格战,人人都会,也人人都伤,把降价做成技术能力就不一样了:一张图装得下九张图的内容,等于用一张的价格卖九张的货。

八 | 而这个折扣,只有装得下的模型给得起,想给同样折扣的对手,得先把4.5K token的长指令、互不干扰的排版这些能力做出来。 降价,被做成了门槛。 这也解释了为什么发布会把GPT-Image-2挂在嘴边。那是目前公认的天花板,也是把文字渲染、信息图当主打能力的模型。 两家瞄着的是同一个方向:图不再是画,可以直接商用的信息载体。 方向对不对,市场用脚投票;各家走到哪一步,得看第三方的尺子。 这里如实交代一句:阿里闭源旗舰没有上过第三方盲测榜,今天「仅次于GPT Image」的信息,来自自家评测,毕竟还没放出来。 但这笔降价的账,往下多想一步,会碰到一个悬着的问题: 按量计费的生意,收入等于单价乘以量;信息密度把客户要买的量压掉一个数量级,单价又没人敢涨。这门生意的收入,以后从哪里长出来?我不知道。 能确定的只有一件事:这个能往图里塞东西的本事,正在变成竞争的胜负手。 ...... 既然是胜负手,为什么偏偏只有这几家能做到?因为回头看那些演示,考的都不是画笔。 把10个像素的字写对,考模型认不认识这个字。九个学科各画各的、互不串门,考它知不知道对数函数长什么样、蜻蜓的翅膀分几节。 三层界面套娃不乱,考它捋不捋得清「界面里的App里的聊天窗里的海报」这种嵌套关系;这些能力拼在一起,有一个统一的名字:语言模型的能力。 文字渲染、世界知识、长指令理解、逻辑结构,没有一样是传统图像模型的看家本领,全是从大语言模型那边外溢过来的。

九 | 外溢还有一个更直接的证据:编辑。 这一代模型把生图、编辑做进了同一个架构。官方的说法是,文生图里积累的文字渲染、细节质感和世界知识,会自然迁移到编辑场景。 所以,你能看到古画修复前后文字不丢、手绘草图直接转成PPT这类演示;能迁移,说明这些本事长在底下那个理解世界的模型里。 另外,线上发布时,有一句话值得单独摘出来。 演示九宫格时,技术负责人说,这个case试了目前市面上的模型,只见到两个能做到;一个是千问3.0。另一个他没点名,语境里指向GPT-Image-2。 注意这两家,都是先把语言模型做进第一梯队,再回头做图像的公司。 牌桌上剩下这两位,不是巧合,图像模型的门槛,已经挪到了语言那一侧。 发布会的结尾也在往同一个方向指,外部嘉宾被问到还期待什么,他说:「我发一张图给你,你捣鼓完直接返我十张能用的。」 技术负责人接的词是agentic image generation。他管这叫三思而后行:一思用户意图,二思收集素材,三思整合统筹。最后才轮到生成。 四步里,前三步全是语言模型的活;生成,那个我们以为的主角,排在最后一步。 我翻了翻这条产品线的发布记录,商业身段的变化也对得上。

十 | 1.0在2025年8月发布时是开源的,那是千问递给开源社区的一张名片;2.0起,旗舰不再开源。

十一 | 到今天的3.0,直接走API公测申请。 开源线没有断,早先的编辑模型至今仍是开源阵营里最能打的,只是旗舰收进了柜台。

十二 | 会画图的模型,开源社区里已经不稀缺了;会读需求文档的模型,稀缺,收进柜台的是后者。 90分钟的发布会,讲一个图像模型,拆到最后,图像可能只是入口,一个「实」字背后,是提示词变成需求文档,一张图当九张图卖,是画画的本事让位给读题的本事。 再往前一步,问题就变成了: 当塞图的能力全部来自语言,图像模型还是一个独立的物种,还是语言模型的一个输出头? 这个问题很有意思。不过看演示的方向,阿里自己可能也在思考。它只是把每一步都往「更实」的方向踩,踩到哪算哪。 我先把我听到、理解后的思考发出来;回头体验一下,也许会有新想法。
Current article:http://pobianbenmailuntiraoeng.cfd/news/20260826_98708.html
Published on:01:54:47
我的网站热门国内