谷歌深夜偷袭OpenAI,白菜价打赢Pro

谷歌在深夜突然发布了Nano Banana 2.1!这款Flash级别的小模型,性能甚至超越了自家的旗舰产品Nano Banana Pro。

核心要点如下:

  • 图像编辑:支持蒙版局部编辑,用户圈选区域即可修改,其余部分保持不变。
  • 一致性:人物或产品经过多轮修改后不会变形,最多可提供14张参考图像。
  • 画质:画面更接近真实拍摄效果,最高支持4K分辨率直出。
  • 价格:出图价格为Nano Banana 2的一半,每张1K图像仅需0.034美元。
  • 榜单:在Arena多图编辑排行榜上位列第4,前面仅有OpenAI的三款GPT Image。
  • 上线:从今天起,Gemini App、搜索AI模式、AI Studio、Flow等平台将陆续可用。

Flash超越Pro,Nano Banana主打性价比?

首先,Nano Banana 2.1仍是Gemini 3系列模型的一部分,基于Gemini 3.6 Flash,知识截止日期为2026年3月。

按照以往的命名规则,Nano Banana 2.1也可称为Gemini 3.6 Flash Image。

根据官方基准测试,Nano Banana 2.1在视觉设计、编辑和一致性方面表现遥遥领先。

尽管在小文本渲染、3D推理和事实性等方面仍有改进空间,但对于需要图像生成和编辑服务的用户来说,这无疑是一次出色的更新:能够以专业级的精度和控制力创建和编辑图像,支持多次快速迭代;为海报和复杂图表生成清晰文字;具备长上下文的现实世界知识;支持多种语言的本地化文字渲染。

网友的盲投结果也证实了这一点。

在Arena竞技场上,Nano Banana 2.1在多图编辑中排名第4,文生图排名第5,单图编辑排名第6。特别是在多图编辑榜上,它前面只有OpenAI的三款GPT Image。相比之下,上一代Nano Banana 2在这三个榜单上分别排名第7、第11和第14。

考虑到出图价格仅为Nano Banana 2的一半,谷歌显然在打价格战。

圈选即改,面部保持不变

蒙版编辑,对熟悉PS的用户来说并不陌生。圈选一块区域后,只修改该区域,其余部分保持不变。

但在AI图像生成中,这一直是个难题。当用户要求“把左下角那个杯子换成红的”时,模型需要先识别出哪个是杯子,然后重新生成整张图,其他部分能否保留全凭运气。

现在,只需圈选即可。换衣服、换招牌、P掉背景中的路人,都只修改圈选的部分。

网友ibexdream连续测试了三个任务:生成、改图和换风格。

第一个任务,画一张纸币。画面上是一位托腮沉思的老哲人,头发向后延伸形成一座迷宫。

第二个任务,在图上进行修改。编号从“№ 1098471”改为“NB-21098471”,两侧的小字也换了,老哲人手中多了一根香蕉作为电话,底部还添加了一条写着“IN BANANA WE TRUST”的飘带。两张图对比,迷宫、长袍和胡子都保持原样。

第三个任务,改变风格,整张纸币变成了一幅油画。

在模型卡的评分中,蒙版编辑这一项,2.1获得了1049分,比Nano Banana 2高出84分,比Pro高出122分。即使不开启思考模式,2.1在每一项上都压制了Pro。

另一项升级是主体一致性,即确保面部不改变。对于拍摄电商图、制作品牌海报或绘制连载漫画的用户来说,同一个模特换十套衣服,到第三套时面部开始变形的情况很常见。这次提升最明显的就是这一项,多人物一致性获得了1106分,比Nano Banana 2高出128分。开发者最多可以塞入10张物体参考图和4张人物参考图,让模型照此生成。

网友BG-VC进行了测试。他提供了一张模特照,以及上衣、半裙、包、鞋、耳环五件单品的参考图,让模型生成六个不同场景的照片,六张都是一次生成。模特走着、坐着、靠在台边,六个姿势中,脸、衣服、包和耳环都没有变形,足以作为一组电商图使用。

画面本身也更像拍摄出来的。官方提供的样图中,挂满水珠的甲虫、粉房子外楼梯上的绿裙姑娘,乍一看难以分辨是AI生成的。

此外,制作信息图时,模型可以先通过谷歌网页搜索和图片搜索查询资料,然后再进行绘制。谷歌的自动评测显示,2.1在信息图事实准确度上得分为0.521,而Nano Banana 2仅为0.179,Pro也只有0.265。换句话说,绘制科普图时,内容错误的情况会大大减少。

图像生成降价,思考功能涨价

出图价格按每百万token 30美元计算,恰好是Nano Banana 2的一半。每张1K图像的价格从0.067美元降至0.034美元,4K图像从0.151美元降至0.076美元。这个价格与7月主打白菜价的Nano Banana 2 Lite完全相同。

不过,其他项目反而涨价了。输入价格从每百万token 0.5美元涨到1.5美元,是原来的3倍。文字和思考的输出价格也从3美元涨到了7.5美元。相当于谷歌将成本从“画”转移到了“想”上。

目前,开发者可以在AI Studio中选择该模型,模型名为gemini-nano-banana-2.1。之前的Nano Banana 2 API将于10月29日关闭。

普通用户也无需等待。Gemini App、搜索的AI模式、Flow、设计工具Stitch、Google Ads和Gemini企业平台从今天起陆续上线。在谷歌App中,点击搜索框下方的香蕉图标即可使用。

网友连夜测试,GPT也被拉来对比

模型上线不到一小时,X上就有网友开始测试。

Mark Kretschmann进行了一项“酷刑测试”,要求在一张图中同时包含人群、杂物、清晰文字、雨天反光,并观察这些元素组合后是否仍像一张真实照片。

Luis Catacora让模型绘制一块茶馆的菜单板,同一款“茉莉绿茶”需要用英语、日语、阿拉伯语和印地语四种文字一次性写出。

Lad则编写了一段专门挑战AI弱点的提示词,要求画面中包含细线纹身、3条项链、一排耳饰、手链,以及一副能透出眼睛的有色墨镜。然后将这段提示词分别交给Nano Banana 2.1和GPT Image 2.5,各生成一张图进行比较。

下面这组图中,左边是Nano Banana 2.1,右边是GPT Image 2.5。Nano Banana 2.1将纹身全部绘制在指定位置,项链、耳饰和手链也都在,但墨镜忘记上色,脸部还被晒红了一片。

Pankaj Kumar选择的对手是GPT Image 2。他让两个模型绘制同一个场景——书桌上放着一块手表,各生成一张图。

左边是Nano Banana 2.1绘制的,自然光,像随手拍摄的。右边是GPT Image 2绘制的,开了台灯,表盘还换成了镂空机芯,带有精修广告图的味道。

速度上的差异更大。API平台AI/ML API准备了5个提示词,每个都让Nano Banana 2.1和GPT Images 2.5各绘制一张。Nano Banana 2.1生成一张图需要11秒,成本0.044美元;GPT Images 2.5需要50秒,成本0.069美元。

Hugo Plat出了4道太空题:旋涡星系、超大质量黑洞、类星体,以及将整个太阳系放入一张图,同样交给Nano Banana 2.1和GPT Image 2.5各绘制一遍。4张图下来,Nano Banana 2.1总共花费0.178美元,GPT Image 2.5花费0.284美元。同一道黑洞题,左边的Nano Banana 2.1绘制得较为克制,右边的GPT Image 2.5则将星云和火焰拉满。

中文方面,知名博主歸藏进行了测试,结论是文字更清晰、错字少了很多,排版也更干净,没有GPT那种破碎感。他还认为,相比GPT,其最大优势是能直接输出4K。

当然,也不是没有破绽。“传承与新生”旁边那行竖排小英文,放大后已经模糊成乱码。

图像生成之战,转向图像编辑

4月,GPT Image 2上线,在同一个Arena的文生图榜上领先Nano Banana 2整整240分。

9月,OpenAI又发布了Images 2.5,主打只修改指定区域、多轮修改不跑偏。

不到一个月,谷歌的2.1也聚焦在这两个方面。

两家公司先后在图像编辑领域发力,原因不难理解。电商、广告、品牌设计等行业,一张图往往需要修改十几版,到第十版还能保持不崩,比第一版惊艳更重要。

因此,谷歌这次直接将2.1整合到Google Ads和企业平台,目标正是这些需要频繁改图的客户。

话说回来,Flash都超越了Pro,Nano Banana Pro的下一代,谷歌打算什么时候推出呢?

参考资料: https://x.com/googleaistudio/status/2107501303890915550

编辑:摩西 大卫 本文来自微信公众号 “新智元”(ID:AI_era),作者:ASI启示录,36氪经授权发布。

亚博平台(yabo)官网-亚博系列全平台入口深耕采用银行级加密技术与多重身份验证机制,保障用户资金与数据安全。领域,用心服务每一位用户。

在7×24小时客户支持,中英文双语服务响应时间不超过30秒。方面,亚博平台(yabo)官网-亚博系列全平台入口提供贴心周到的支持。

亚博平台的技术团队基于大数据与AI算法开发了智能路由系统,能够自动选择最优交易路径,将处理延迟降至毫秒级。同时,7×24小时客户支持团队提供中英文双语服务,响应时间不超过30秒,确保用户问题得到即时解决。

亚博平台(yabo)官网-亚博系列全平台入口以与多家持牌金融机构深度合作,资金流转全程受监管机构监控。为核心,带来高效便捷的体验。