Nano Banana 2.1 的进步不在「画得更好看」,而在「改得动」

谷歌今天正式发布图像模型 Nano Banana 2.1。官方把改进拆成三块:视觉设计、基于蒙版的局部编辑、主体一致性。多数报道会盯着第一块,但我认为后两块才是真正会改写工作流的部分——它把图像模型从「一次性生成器」推向「可反复修改的素材工具」。
这次改的三件事,指向同一个方向
- 视觉设计:生成素材的构图与完成度更高,减少「一眼 AI 感」。
- 蒙版编辑:可以精准选中并修改现有图像的局部区域,不必重新生成整张画面。
- 主体一致性:编辑或批量生成关联图片时,更好地保留主体样貌与特征。
三者解决的是同一个问题:可控性。生成式图像早期比的是「一次成图好不好看」,但真实项目里大部分时间花在「第 3 版比第 2 版差在哪、怎么只改那一只袖子、改完别把背景也改了」。
为什么「一致性」才是分水岭
主体一致性决定了同一角色、同一产品能否稳定出现在多张图里。它直接决定三件事能不能成立:品牌素材的批量产出、分镜与连环画面、以及操作教程里的步骤图。没有一致性,模型只能做单张插图;有了一致性,它才开始能做「素材库」。
对实际工作流的影响
- 做运营与电商的,可以在不改动未编辑区域的前提下,把同一商品换背景、换季节、换模特姿态,边际成本显著下降。
- 做内容与培训的,步骤图、界面示意、角色插画的返工次数会明显减少。
- 对开发者,模型 ID 为
gemini-nano-banana-2.1,支持文本、图片、音频、视频输入,可输出 1K/2K/4K 分辨率,接入面覆盖 Gemini 应用、搜索 AI 模式、AI Studio、Flow、Stitch 与 Gemini 企业平台。
一个冷静的提醒
官方口径之外,行业媒体指出 ChatGPT Images 2.5 在「持续微调同一张图」这件事上仍然领先:更擅长保留上一轮修改成果、不动未编辑区域、反复迭代不降质;微软的 MAI-Image-2.6 紧随其后。也就是说,这一轮的竞争已经不是「谁画得漂亮」,而是「谁在第十次修改后还站得住」。
建议:如果你的流程里有大量「改局部、保整体」的活,值得用它做一次 A/B;如果你的需求只是出单张配图,升级带来的体感会小得多。
参考来源
延伸阅读:63GW 涨到 474GW:数据中心的瓶颈已经不在芯片,在并网队列 · DLSS 5 正式版体验:十年没进步的游戏画面,英伟达怎么让它以假乱真?