重磅!Nano Banana 2.1震撼发布,专业设计师的新利器

2026-10-08 11:17:55未知 作者:徽声在线

徽声在线编辑部


在Nano Banana 2发布数月之后,谷歌终于对其产品线进行了重要更新。

今日凌晨,Google DeepMind正式推出了Nano Banana 2.1版本。

虽然从命名上看,这只是一次微小的“0.1”级升级,但谷歌的评价却毫不吝啬:新版本在Nano Banana系列的基础上实现了显著提升,特别是在视觉设计、蒙版编辑、主体一致性以及图像自然度方面有了质的飞跃。



尤为引人注目的是,Nano Banana 2.1并未改变其原有的发展方向。它继续追求Flash级别的速度和成本效率,同时不断向专业图像生成和编辑领域迈进。谷歌将其定位为最新的高效率图像生成与对话式编辑模型,旨在满足专业设计师和开发者的需求。



目前,Nano Banana 2.1已经成为Gemini API中的稳定模型,其模型ID为gemini-nano-banana-2.1。根据谷歌公布的信息,该模型已被分发至Gemini App、Google AI Studio、Gemini API、Google Search AI Mode、Google Ads、Flow和Stitch等多个产品与开发平台,供用户广泛使用。

从谷歌公布的模型卡和评测成绩来看,这次升级并非仅仅停留在表面,而是带来了实质性的提升。



模型卡地址:https://storage.googleapis.com/deepmind-media/Model-Cards/Nano-Banana-2-1-Model-Card.pdf

底座升级为Gemini 3.6 Flash

Nano Banana 2.1隶属于Gemini 3系列,其底层基于Gemini 3.6 Flash构建。

这意味着,它继承了Gemini原生多模态模型的能力,能够理解文本和图像输入,并生成相应的图像与文本。谷歌对其的定位非常明确:面向高效率的图像生成和对话式编辑,在保持Flash级别的速度和成本优势的同时,提高最终输出质量。

在开发者层面,新模型支持1K、2K和4K等多种分辨率输出,并专门优化了1:4、4:1、1:8、8:1等宽幅和超宽幅画面的平铺伪影问题。此外,多图融合功能现在可以接收多达14张参考图,并支持多角色和多物体的一致性处理,为开发者提供了更大的灵活性和创作空间。

这些更新背后的方向非常明确:谷歌正致力于将Nano Banana从一款简单的图像生成工具,转变为一套可以反复修改、保持素材一致、处理复杂版式的视觉生产工具。

最显著的提升,

首先体现在“设计感”上

生成模型能够画图,并不意味着它就能胜任设计工作。

一张宣传海报、一张网页视觉或者复杂信息图,往往需要同时考虑排版、字体、留白、层级、颜色以及多个视觉元素之间的关系。此前,许多生成模型虽然能够将单个物体画得很好,但在面对完整的平面设计任务时,却容易出现信息层级混乱、文字位置失控,或者整体看起来“元素很多,却不像设计稿”的问题。

Nano Banana 2.1针对这一问题进行了显著强化。

谷歌在官方展示中给出了瑞士平面设计、复古海报和网页UI等案例。在这些案例中,模型需要理解完整的设计要求,并将字体、图片、色块和版式等元素有机地组织到同一画面中,而非简单地生成某个主体。



评测结果也充分证明了这一变化。

在开启Thinking功能的情况下,Nano Banana 2.1在Infographic Design方面的得分达到了1048,而此前Nano Banana 2的得分为961,Nano Banana Pro的得分为912;整体偏好得分则为1050,此前两款模型分别为990和935。Google的这部分评测采用了侧对侧人类评价方式,并通过Elo形式衡量整体偏好和设计质量。



因此,这里的变化更接近于“成品完成度”的提升。模型开始更稳定地处理一整张视觉作品的结构,而非单独优化某一个生成元素。对于广告物料、社交媒体配图、海报、电商视觉和UI Mockup等领域来说,这种能力比单纯增加画面细节更具实际价值。

AI改图中最难处理的局部编辑,

也成为了这次升级的重点

Nano Banana最初引起广泛关注的一个重要原因,就是它将生成和编辑功能整合到了同一套自然语言交互中。

在Nano Banana 2.1中,谷歌继续加强了其中最容易出错的一环:基于蒙版的局部编辑(Mask-based Editing)。

局部编辑看似简单,实际上对模型的约束非常强。例如,当用户圈出图片中的一个物体并希望改变其周围环境时,模型需要准确理解蒙版指定的范围,并避免修改画面中原本无需改变的内容,同时保持主体的位置、尺寸和外观不变。



在Mask/Ink-Based Editing评测中,Nano Banana 2.1在开启Thinking功能后的得分达到了1049,而此前Nano Banana 2的得分为965,Nano Banana Pro的得分为927。更广义的General Editing得分也由此前两款模型的938、939提升至1026。

这一能力将直接影响生成式图像工具能否真正进入实际工作流。在实际设计过程中,很少能够一次就得到终稿,更多时候需要一轮轮的局部调整:换掉背景但保留产品、改变衣服但保持人物不变、重做某一块排版同时尽量保持其他部分不动等。

生成模型越能精确控制修改范围,就越接近传统Photoshop等编辑软件所提供的确定性。

将多个人物放在一起时,

更不容易出现换脸问题了

另一项显著提升集中在主体一致性方面。

对于单张图片生成而言,模型将一个人物画得逼真已经并不罕见。真正困难的是在连续生成后,这个人仍然像同一个人;或者在一次引入多个人物、多件产品后,每个主体都能保持原本的特征不变。这也是角色故事、广告摄影、电商素材和连续视觉内容中经常遇到的问题。

Nano Banana 2.1在多人场景下的提升尤为突出。

在谷歌的评测中,单角色一致性得分从Nano Banana 2的981提升至1028;多角色一致性得分则从978大幅提升至1106。后者也是整个编辑评测表中差距非常明显的一项。即使与Nano Banana Pro的1011相比,Nano Banana 2.1也保持了领先地位。



谷歌官方展示了将多名不同模特参考图组合到同一时尚大片中的案例。这需要模型同时处理人物身份、服装、距离、姿态以及整体场景关系等多个复杂因素。



这种能力进一步向“素材复用”靠近。一次拍摄或者一组产品图可以被重新放进不同场景中;已有角色能够继续出现在后续画面中;一组人物也可以组合成新的视觉作品。对于商业设计来说,主体一致性的价值就在于此:生成结果不再是一张张彼此孤立的图片。

继续消除那种熟悉的“AI味”

Nano Banana 2.1的另一项官方重点是生成更加自然的图像(more natural-looking imagery)。

Google API文档明确提到,新模型提升了1K、2K和4K分辨率下的视觉质量与真实感。官方展示的样例涵盖了微距昆虫、人物摄影、自然景观、静物以及绘画作品等多个领域,重点强调了材质、光线、空间关系和细节的自然程度。

这一方向虽然不像蒙版编辑那样容易量化,但却直接决定了生成图片给人的第一印象。

过去生成图片中常见的问题是局部细节很丰富,但画面整体却存在一种过度平滑、过度戏剧化或者材质趋同的感觉。随着模型逐渐进入广告、摄影、电商和内容生产等领域,单纯追求“精致”已经不够,生成结果需要更接近真实世界里摄影、材质和光线本身的复杂性。

Nano Banana 2.1对这一点的强化与它的产品定位相契合:在保持Flash速度的同时提高实际交付质量。

谷歌继续押注信息图这条路线

Nano Banana系列还有一个具有谷歌特色的能力:它可以调用Gemini的世界知识,并利用Google Web Search和Image Search进行grounding操作。

这使得图像生成开始与Gemini的知识和搜索能力相结合。

例如,在让模型生成地球结构示意图、云层分类、面粉种类比较或者某一历史建筑时,它可以先理解相关知识,再组织视觉结构。谷歌将这一能力应用于信息图、教育图示以及具体真实对象的生成等多个领域。

这次模型卡中的数据也非常值得关注。

在Infographic Factuality指标上,Nano Banana 2.1在开启Thinking功能后的得分为0.521,而Nano Banana 2的得分为0.179,Nano Banana Pro的得分为0.265。谷歌对这一指标使用AutoRater进行评估。

与此同时,文字渲染也继续得到了优化。谷歌表示Nano Banana 2.1提升了文字生成与信息图布局准确度,这对于海报、营销物料和复杂图示等领域来说尤为重要。

生成模型正在逐渐将“查资料—理解内容—组织版式—生成图片”这一流程连接起来。对于信息图而言,这比单纯把文字画清楚更进一步。

不过,2.1版本还远未解决图像生成的所有问题

从谷歌自己公布的模型卡来看,Nano Banana 2.1仍然存在一些明确的限制。例如,小字号文字在1K输出中仍可能模糊;长段落和整页文本的渲染质量仍然有限;输入图片和生成图片之间的角色一致性也并非始终稳定。

蒙版和涂鸦编辑虽然已经得到了提升,但仍可能出现指令执行不完整以及编辑痕迹残留等问题。部分情况下,模型还会过度继承原图中主体的姿态和结构。左右等空间位置关系偶尔也会判断错误。谷歌同时承认,在世界知识、高级3D推理和事实准确性方面仍有提升空间。

因此,Nano Banana 2.1更适合被理解为一次针对实际生产体验的集中升级。虽然版本号只增加了0.1,但谷歌调整的却恰好是生成式图像真正进入工作流之后最容易暴露问题的地方:设计完成度、局部控制、连续编辑中的一致性以及最终图片看起来够不够自然。

从这个角度看,Nano Banana 2.1的意义或许就在于此:谷歌正在将“会生成图片”这件事进一步推进到“能够持续完成视觉工作”的新阶段。

https://x.com/NanoBanana/status/2107521202466046453

https://x.com/Google/status/2107501209154204148

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 健康管理成全球政策新焦点 外滩热议AI如何引领“主动健康管理”新风尚健康管理成全球政策新焦点 外滩热议AI如何引领“主动健康管理”新风尚 地平线押注车企中“沉默的大多数”地平线押注车企中“沉默的大多数”
相关文章
重磅!Nano Banana 2.1震撼发布,专业设计师的新利器重磅!Nano Banana 2.1震撼发布,专业设计师的新利器 亚马逊零售部门启动千人级岗位优化,促销季引发关注亚马逊零售部门启动千人级岗位优化,促销季引发关注 AI融资狂潮!SpaceX、博通、甲骨文竞相筹集巨资AI融资狂潮!SpaceX、博通、甲骨文竞相筹集巨资 存储芯片需求激增!三星Q3营业利润飙升近8倍 创历史新高突破100万亿韩元存储芯片需求激增!三星Q3营业利润飙升近8倍 创历史新高突破100万亿韩元 科技前沿|SpaceX筹400亿购英伟达芯片;苹果一号电脑或拍高价科技前沿|SpaceX筹400亿购英伟达芯片;苹果一号电脑或拍高价 英伟达首度冲击6万亿美元英伟达首度冲击6万亿美元