谷歌最强生图模型Nano Banana 2曝光:能解数学题伪造监控?
本帖最后由 八云红 于 2025-11-10 17:25 编辑AI圈真是瞬息万变,就在大家还在玩转第一代Nano Banana的时候,谷歌的下一代AI图像生成模型 Nano Banana 2突然就现身了,而且这次展示出的能力,只能用“惊艳”来形容。它不仅能画出以假乱真的UI界面,甚至还能解答数学题。
Nano Banana 2 预览版短暂现身
这次Nano Banana 2(又名 GemPix2)是以预览版的形式,短暂出现在第三方网站Media.io上的。虽然很快就被移除了,但还是被少数手快的网友测试了一把。
根据测试页面说明,Nano Banana 2主要在真实性、生成速度和自然交互控制上做了改进。从流出的测试结果看,它的能力确实远超前代,尤其是在处理复杂提示方面的表现非常突出。
AI生成能力全面升级
Nano Banana 2能够生成极其复杂的UI界面,而且文字渲染几乎看不出破绽。下面这张图,不仅包括网页内容,甚至整个浏览器界面和桌面背景都是AI生成的,而且没有参考图像。很多人第一眼都会以为这是一张真实的电脑截图。
它对物理常识和提示词细节的遵循也表现得很好。比如,可以同时准确绘制出指向特定时间的时钟和一杯斟满的红酒。
更令人震惊的是,Nano Banana 2甚至能伪造出逼真的监控录像画面。这个能力引起了不小的讨论,不过据推测,在正式版发布时,这方面的能力应该会受到严格限制。
掌握逻辑推理,能画公式解数学题
此外,Nano Banana 2还掌握了一定的世界知识与逻辑推理能力。
在解决数学问题的对比测试中,第一代Nano Banana虽然解题思路好像大致方向是对的,但最终渲染出的公式基本无法理解。而Nano Banana 2在解题时,虽然也有一些小错误,但它生成的解题步骤和数学公式已经非常清晰,结果给人留下了深刻印象。
回顾Nano Banana一代:强大的图像编辑能力
回顾一下,第一代Nano Banana最初在2025年8月匿名登场,凭借出色的图像编辑能力迅速登顶排行榜。它的代号源于谷歌内部测试生成“香蕉大小的纳米机器人”时效果很好。
第一代的核心优势在于强大的图像编辑和理解能力,包括自然语言编辑和角色一致性。用户可以用日常语言进行多轮迭代的图像修改,同时解决了AI图像编辑中常见的“身份漂移”问题,能保持角色特征在多次修改后高度一致。
同时,它还支持多图像融合与风格迁移,加上平均1.3秒的响应时间和极低的生成成本,上线后迅速为Gemini应用带来了千万级的新用户。
之前Nano Banana的核心团队就透露,他们认为图像生成的质量已接近上限,未来的关键在于提升模型理解用户“意图”的能力。这次Nano Banana 2在解数学题和生成复杂UI上的表现,似乎就在朝这个方向努力。虽然谷歌DeepMind方面还没有公布Nano Banana 2的正式发布时间,但谷歌显然正在加速将其整合进搜索、相册等核心产品生态。一个无缝的AI驱动视觉体验闭环,可能很快就要来了。
这么快nano banana2就要来了?
页:
[1]
