Nano Banana Pro 全面评测:图像生成新能力解析
正如大家所期待的那样,Nano Banana 的第二个版本终于发布了。有人称它为 Nano Banana 2,也有人称它为 Nano Banana Pro。相比前代,Nano Banana Pro 能够生成更复杂的图像,并在参考图生成任务中保持更高的风格与结构一致性。本篇将围绕两个核心问题展开:第一,如何使用 Nano Banana Pro;第二,它具体能完成哪些图像生成任务。
需要注意的是,Nano Banana Pro 与上一版本最大的区别在于——它不再是免费模型。过去我们习惯在 Google 的 AI Studio 中调用 Nano Banana,但如今在模型列表中选择 Nano Banana Pro 后,系统会提示输入 API Key,即必须付费才能使用。不过,我们仍可在配置面板中查看其关键参数信息,例如支持 1K、2K 和 4K 三种输出分辨率。
那么,是否有免费使用 Nano Banana 的途径?答案是:有,但有限制。目前可在 Google Gemini 平台免费试用,但存在调用次数限制。另一种方式是通过部分商业平台接入其 API,例如 Runway ML(常被简称为 Runway Hub)。我在 Runway Hub 上已构建好 Nano Banana Pro 的工作流,用户可通过 Runway Hub 网站直接访问并运行。
Runway Hub 是一个非常活跃的在线 AI 工作流平台,对新模型和新技术响应迅速。用户可通过视频描述区提供的邀请链接注册,获得 1000 点免费积分;此外,每日登录还可额外领取 100 点积分,便于尝试各类工作流。
接下来我们来看该工作流的具体使用方式。由于采用 API 接入模式,整体操作较为简洁。流程中会用到一个标注为 “new” 的节点,表明这是最新版模型。在下方配置项中也能看到明确标识,确认其为 Nano Banana Pro 模型。例如,分辨率选项仍支持 1K、2K 和 4K 三种规格。
我们进行一次简单测试:将输出比例设为 16:9,提示词为“飞机引擎,含中英文文字标注”。运行后可见结果非常理想——中文与英文标注均准确呈现,说明该节点在文生图任务中表现优异。
对于图生图任务,有两种常用方式:
第一种是将全部参考图统一输入至 `image_batch` 输入端口。但这种方式需将所有图片打包为一个 batch,不利于精细控制生成顺序与特征对应关系;
第二种则是分别将每张参考图单独连接至对应的 `image1`、`image2` …… `image9` 输入端口。当前节点最多支持 9 个独立图像输入,实测中即便输入 15 张参考图也能基本生效,但官方建议控制在 5 张以内以确保效果稳定。若输入过多(如 6 张),可能出现特征混淆或复刻偏差。
例如,我们输入 6 张人物照片,提示词为“6 个美女在春游时的合照”,设定输出比例为 9:16、分辨率为 2K。生成结果中,每位人物的基本特征均被较好保留。但需注意:当参考图数量较多时,面部细节的还原精度会下降,人物长相与原图存在一定差异。因此,为保障复刻质量,推荐参考图数量不超过 5 张。
关于费用,Nano Banana Pro 的计费标准如下:生成 1K 分辨率图像每次收费 0.25 元人民币;4K 图像则为 0.5 元/次。整体成本较低。
接下来我们通过多个代表性案例,展示 Nano Banana Pro 的实际能力边界。需要说明的是,以下所有示例均来自公开网络平台,非本人原创,仅作技术能力演示之用。
**案例一:双语工程图生成**
提示词要求生成一张飞机引擎结构图,并同时包含中文与英文标注。结果中文字体清晰、术语准确,证明模型已具备可靠的中文渲染能力。
**案例二:物理概念可视化**
要求生成牛顿色散实验示意图,精确展现三棱镜分光过程,并在图中标注相关物理公式。最终输出不仅构图合理,且公式书写规范、位置准确,体现出模型在科学绘图领域的推理与表达能力。
**案例三:数学题解图生成**
输入一道几何题,要求模型理解题意并在草稿纸上绘制解答过程。生成结果虽未验证数学正确性,但图形结构与题目完全对应,视觉可信度高。
**案例四:动漫转写实**
提供一张动漫风格人物图,要求转换为高度写实的人物肖像。结果呈现出电影级质感,无明显 3D 渲染痕迹或动漫风格残留,人物神态、服饰细节均自然融合。
**案例五:高精度物理现象模拟**
使用长文本中文提示词,详细指定平抛运动图中各元素的位置、字体大小、颜色及线条粗细。生成图像几乎逐条满足所有描述,体现极强的提示词遵循能力。
**案例六:跨文化角色融合**
提示词要求生成“大闹天宫”场景,但主角由孙悟空替换为《猫和老鼠》中的杰瑞。结果中杰瑞的形象与孙悟空服饰、姿态完美结合,既保留经典角色特征,又达成创意融合。
**案例七:产品海报设计**
提供两款香薰产品(品牌名 Two Summer)的实物图及中英文标识,要求生成符合品牌调性的宣传海报。结果中产品外观、文字排版、环境布置均与提示词高度一致。
**案例八:失败案例观察**
尝试生成“动漫人物置身真实场景”的图像,结果出现左右高度对称的异常构图。这说明模型仍存在失败概率,并非每次都能成功生成理想结果。
**案例九:POV 视角转换**
输入一张“美女双手捧花”的正面照,要求切换为第一人称视角(POV)。生成图像准确呈现手捧鲜花的主观视角,空间感与透视关系自然。
**案例十:东方幻想场景构建**
中文提示词描述“拥挤的北京地铁车厢内全是神话人物,车厢连接处滚动显示‘前往西天取经的乘客请注意,前方到站高老庄’,车窗贴有‘禁止在车内施展法术’标语”。生成结果中人物身份识别明确、滚动字幕内容准确,但“禁止施展法术”标语未出现,说明复杂多要素提示仍存在漏检可能。
**案例十一:平面图转 3D 写实渲染**
输入一张房屋平面图,要求生成写实风格的 3D 室内效果图。对比原图可见,空间布局、门窗位置、装修风格等关键信息还原度极高,远超多数同类模型的表现。
综上,Nano Banana Pro 在多语言支持、科学可视化、跨模态理解、高精度提示遵循、风格迁移及复杂场景构建等方面展现出显著进步。其所覆盖的应用场景,已远超传统文生图或图生图的常规测试范畴。