最近 Nano Banana 2.1 刚出来,我也趁热做了一个小站:
利益相关先说在前面:站是我自己做的。
目前也还在比较早期的阶段,先围绕 Nano Banana 2.1 把图片生成、编辑和一些实际案例做起来,没有打算一上来就堆几十个所谓的 AI 功能。
这两天自己也一直在测这个模型。
我的感觉是,这次 2.1 看版本号好像只是一个小更新,但实际上它优化的东西,很多刚好都是 AI 生图从「能玩」走向「能干活」之后比较重要的东西。
Google 官方对 Nano Banana 2.1 的定位是高效率图片生成和对话式编辑模型,是 Nano Banana 2 的升级版本。
官方文档:
这次比较值得关注的包括:
- 图片真实感继续提升
- Prompt 遵循能力增强
- 文字生成和信息图排版更好
- 多轮修改时角色一致性更稳
- 支持 1K / 2K / 4K
- 最多支持 14 张参考图
- 最多可以维持 4 个角色的一致性
- 最多可以参考 10 个对象
- 支持 Google Search Grounding
- 可以调节 Thinking Level
但这些参数其实不是我最关心的。
我现在越来越觉得,判断一个图片模型好不好,已经不能只看:
「第一张图够不够惊艳?」
以前测试 AI 生图,很容易就是输入一句:
一个女生站在东京街头,电影感,夜景,8K
然后看看哪个模型生成的小姐姐最好看。
这种测试其实挺爽,但跟真实使用场景还是差挺远的。
真正开始拿 AI 图片做产品以后,问题会变成:
做电商图的时候,商品能不能别给我改了?
做人像的时候,同一个人连续生成五张还是不是同一个人?
做海报的时候,字能不能别写错?
换一个背景的时候,能不能只换背景,不要顺便把人物脸也换了?
连续修改一张图的时候,改到第五次还能不能保持原来的设计?
这些问题,我现在反而觉得比「单张图片有多惊艳」重要。
Nano Banana 2.1 和其他模型,我目前的一些感受
先说 Nano Banana 2.1 。
我觉得它越来越像一个综合型选手。
不是某一个能力特别极端,而是生成、参考图、图片编辑、文字、多图融合、角色一致性这些能力都在往比较实用的方向发展。
再加上它本身还是偏 Flash / 高效率这条路线。
如果是:
- 电商商品图
- 广告素材
- 社媒配图
- 海报
- 多参考图生成
- 同一个角色反复生成
- 一张图片连续修改
这种需要大量迭代的场景,我觉得 2.1 会挺舒服。
尤其是做产品以后,我越来越在意一个指标:
出图可用率。
假设模型 A 一张图便宜 20%,但是平均要抽 5 次才能用;
模型 B 贵一点,但是 2 次就能出我要的结果。
最后真正算成本的时候,B 反而可能更便宜。
这个也是我觉得现在很多模型排行榜比较难体现的东西。
和 Nano Banana Pro 比
Nano Banana Pro 我觉得还是有自己的位置。
Google 对 Pro 的定位本来就更偏:
professional design engine
也就是复杂设计、4K 图片、复杂排版、文字这些专业场景。
但 2.1 出来以后,两边的使用范围确实越来越接近了。
至少对我来说,以后日常大量生成,我应该会优先用 2.1 。
遇到特别复杂的设计任务,再拿 Pro 对照测试。
换句话说:
Pro 更像“大活选手”,2.1 更像每天干活的默认选手。
当然这个结论也不是绝对的,不同 Prompt 差异还是非常大。
和 ChatGPT Images 2.5 比
OpenAI 上个月也刚更新了:
这一代我自己比较喜欢的还是它的编辑体验。
特别是已经有一张不错的图片以后,只想说:
把桌子上的杯子换成黑色,其他东西不要动。
这种任务其实非常考验模型。
因为很多图片模型嘴上答应你「只改杯子」,然后:
杯子改了, 桌子也变了, 灯光变了, 人物脸也顺手整容了。
OpenAI 这代明显也在继续解决这个问题,官方重点强调的就是图片保真、精准编辑和多轮修改的一致性。
所以如果是:
已有图片 → 精准修改 → 再继续修改
我现在还是会把 ChatGPT Images 2.5 一起拿来测试。
Nano Banana 2.1 出来,并不意味着其他模型就没用了。
反而模型越多以后,我觉得「不同任务选不同模型」会越来越明显。
Seedream 我也觉得不能忽略
国内这一条线我最近也一直有关注。
现在比较新的已经是:
Seedream 现在的方向也挺有意思。
它不只是强调:
“我能生成一张好看的图。”
而是越来越强调:
“我能不能理解你到底想设计什么。”
像复杂信息可视化、文字排版、局部编辑、多图融合、真实人像这些都在加强。
这种方向我其实挺认同的。
因为 AI 图片最终要真正进入生产环境,模型要解决的就不是单纯「画画」问题,而是某种程度上的:
视觉任务理解。
我现在反而没那么在意“哪个模型第一”
过去可能会问:
Nano Banana 和 GPT Image 到底哪个强?
现在我感觉这个问题越来越难回答。
因为可能:
A 模型做人像最好;
B 模型改图最稳;
C 模型文字最好;
D 模型商品一致性最好;
E 模型又特别便宜。
而普通用户其实根本不想研究这些。
一个做 Shopify 的卖家,只是想:
帮我把这个商品做成一套圣诞节广告图。
他其实并不在乎后面跑的是:
Nano Banana 2.1 、
Nano Banana Pro 、
ChatGPT Images 2.5 ,
还是 Seedream 。
他只关心最后这张图能不能直接拿去投广告。
所以我现在越来越觉得,AI 图片产品下一阶段真正有意思的事情,可能不是:
我接入了 20 个模型。
而是:
用户告诉系统自己想干什么,系统自动选择模型、Prompt 和工作流。
比如:
商品主图是一套工作流;
商品换背景是一套工作流;
AI 换衣是一套工作流;
广告海报是一套工作流;
角色一致性又是另外一套工作流。
模型慢慢变成基础设施,场景和工作流才是用户真正使用的产品。
这个也是我做这个站的时候,自己想慢慢验证的一个方向。
站现在还是比较早期。
先把 Nano Banana 2.1 本身的体验和案例做好:
如果大家最近也在折腾 AI 生图,欢迎帮我试试。
有不好用的地方可以直接说,也欢迎