拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Nano Banana 提示词实战:掌控 GPT-4o 与 GPT-5 图像风格

Nano Banana 提示词实战:掌控 GPT-4o 与 GPT-5 图像风格

简介:面向AI绘画爱好者和设计师的提示词合集,聚焦Nano Banana、GPT-5、GPT-4o等模型的图像生成场景,通过500多个真实案例展示不同风格与题材的prompt写法,覆盖电影风格肖像、国风水墨、科技蓝图、动漫风格等多元需求。案例编号自464至508,涵盖照片级人像、历史时间轴、数学题图解、品牌海报等丰富主题。压缩包共726个文件、约261MB,其中500余张jpeg/png图片为案例效果图,3个md文档、2个html页面便于阅读和检索,还有少量css/js文件用于本地展示。已有71人学习,适合希望提升AI绘画提示词技巧、快速获取灵感或复现同款作品的用户。资料将案例编号化、分类呈现,从热门电影感写真到传统文化插画均配有完整提示词和生成示例,可直接对照参考,尤其适合作为风格探索与提示词工程的学习样本。

1. Nano Banana 提示词是什么:一句 nanobanana 为什么能让 GPT-4o 整张图换气质

在 GPT-4o 的对话框里输入“画一只伸懒腰的橘猫”,和同一句话最前面加上nano banana,出图经常像两个模型画的。前者更接近 AI 默认的“高清插画感”,后者则是低饱和、带柔和胶片颗粒、光比收敛的写实摄影味道。Nano Banana(也写作 nanobanana)并不是官方接口参数,而是社区在大量对比后沉淀出来的一套 Image Prompts 写法:用一组固定的风格锚词,把模型的审美分布强制拉向某个方向。对没跑过图的人这像玄学,对天天跑图的人来说,这是一套可以复用的配方。

下面要把这套配方拆成真正能用的生产力:提示词怎么分层、哪些参数真实生效、从 GPT-4o 迁到 GPT-5(也有人直接简写成 GPT5)时哪些写法必须改,以及照搬模板最容易翻车的 5 个场景。适合正在做批量视觉内容、想稳定出图的设计师和提示词工程师;既能照着复制,也能拿里面的方法重新搭一套自己的风格模板。

2. 把 Nano Banana 提示词拆成五层:从模板到参数的实战落地

网上流传的 nanobanana 提示词版本一大把,但把长度和措辞去掉后,核心都是五层结构:风格锚点、主体与场景、光线、材质影调、构图与限制。至于图像尺寸、出图张数、随机种子这类参数,更合适放在调用侧而不是写进提示词里。

有一个现象需要先说清楚:同一套词,有人出图“好看但不像”,原因是把风格词和内容词混在了同一个并列层里。比如nano banana, a teapot, film grain, centered这种写法,模型看不出哪部分是风格、哪部分是主体,只能按位置和词频猜权重。分层的目的就是为了让模型少猜。

2.1 先看一个可运行的五层模板

下面是一段可以直接贴进 GPT-4o 对话框的模板,行与行之间职责不同。复制之后重点看分层,不要逐字照抄。

# 不写 --ar 3:2 这类 Midjourney 参数,GPT-4o 不认 nano banana, cinematic film still, 35mm photography, a hand-thrown ceramic teapot on a wooden desk, soft window light from the left, color temperature 4200K, gentle vignette, film grain 200, matte finish, no plastic highlights, no HDR, no watermark, object centered, simple composition, f/4, shallow depth of field

第一行是风格锚点。nano banana负责把采样分布往胶片、写实的方向拉,cinematic film still和35mm photography负责约束画面更像电影截图而不是插画。这个做法的逻辑是:GPT-4o 生成图像时会根据整句提示词去匹配训练时见过的图片簇,nano banana作为高频风格标签,能把整体审美带偏;如果只写“茶壶”,模型会优先找它最熟悉的电商白底图那一类分布。

第二行是主体与场景。主语只留一个,不要写“茶壶和马克杯”,因为并列名词在 GPT-4o 里经常被拆成两个主体各占一半画面。第三、四行是光线和影调。color temperature 4200K并不会被精确理解成色温数值,而是一种偏暖色温的方向暗示;film grain 200同理,只是颗粒感的程度提示。

第五行是负向限制。no HDR避免过曝的塑料感高光,no watermark避免模型顺手在角落生成一行无法识别的水印。第六行是构图硬约束,其中f/4是伪参数:GPT-4o 并不理解它是光圈值,只把它当成“背景虚化”的同义词,所以必须搭配shallow depth of field,否则模型偶尔会把f/4当成画面里的文字画进背景。这是社区里反复确认过的坑,照搬时留意。

2.2 在 GPT-4o 里真正生效的 Image Prompts 参数

提示词和参数有个常见的张力:对话框里键入--ar、--q、.5这类 Midjourney 参数,对 GPT-4o 几乎无效,还会白白占用上下文。真正能控制出图结果的那些点,要单独配置到服务调用端。

控制项推荐做法作用
图像尺寸在调用接口设size,例如 1024x1024决定构图比例;提示词里写“竖构图”不可靠
一次出图数在调用接口设n批量采样比反复改提示词更稳定
随机种子在调用接口固定seed固定初始噪声,便于排查提示词问题
主体出现次数在提示词里写subject appears once抑制内容词被放大成“满地都是茶壶”
示例图首图生成后作为后续编辑的输入图避免同一提示词每次重新采样导致漂移

最容易忽略的是seed。当你想判断“是不是提示词本身有问题”时,固定 seed 重跑一次才有可比性;如果不固定 seed,每次出图都是一次独立采样,你根本分不清是坏词导致的,还是纯随机导致的。这里再补充一个容易踩的细节:GPT-4o 并没有真正固定的“色温参数”,提示词里如果同时出现相互冲突的光线描述,比如morning light和midnight,模型不会报错,而是随机挑一种来生成。批量跑图前,最好先扫一遍有没有这类冲突词。

2.3 风格锚点和负向词的比例需要控制

很多人喜欢往 Nano Banana 模板里堆词,把grain, noise, dust, scratches, high detail, detailed texture全放进去,结果纹理反而裂开。一个比较实用的比例是:风格锚点词 2 到 4 个,光线词不超过 3 个,负向词不超过 3 个,其余位置留给主体描述。看一个缩到最小的示例:

nano banana, 35mm film still, indoor morning light, a ceramic teapot on a wooden desk, centered, matte finish, no over-sharpening

这段相比完整模板,把风格词的密度提高,出图会更偏向“平均的胶片感”。反过来,如果发现出图很有味道但主体跑偏,不要急着加主体词,先检查风格锚词是不是把主体词的位置挤掉了。nano banana在新模型上一旦权重过高,画面主体甚至直接变成香蕉,这就是迁移到 GPT-5 时要重点处理的问题。

3. 从 GPT-4o 迁到 GPT-5:Image Prompts 的写法要改哪几处

标题里常写的 GPT-5(GPT5) 是同一个模型代际,很多人也直接称呼 GPT-5。模型每换代一次,提示词里“魔法前缀”的效力就会衰减一层。GPT-4o 时代nano banana可以直接压住整张图的风格;到了 GPT-5 的图像管线,训练数据和输入重写策略都在变化,继续把前缀当免死金牌就是赌博。并不是说新模型不支持这套风格,而是它更倾向于理解描述性结构,而不是标签堆叠。

3.1 短标签在 GPT-5 上为什么容易失效

GPT-4o 对短标签格外敏感,nano banana是高频标签,能直接唤起一个视觉分布。问题在于,新一代模型倾向于把提示词拆分成“主体、环境、风格、限制”几个槽位;当你只写nano banana, living room, a sofa, golden hour,模型当成并列关系处理,风格锚点未必比sofa更强。要得到一致结果,就得把暗号翻译成定义:

# GPT-4o 时代的短写法 nano banana, living room, a sofa, golden hour, film grain # GPT-5 时代的写法 Interior photography of a living room with a linen sofa; photography style: natural light at golden hour, colors slightly desaturated, soft film grain like Fuji 400, gentle contrast, no over-sharpening, do not change the sofa's fabric texture

第一版全部是并列名词,模型需要靠概率猜谁重要;第二版用分句把“室内摄影”“风格定义”“限制条件”切成三层,风格信息不再和主体信息互相撕扯。从 GPT-4o 迁到 GPT-5 的 Image Prompts,本质上是从贴标签转向写说明书。风格锚词仍旧有效,但它需要有个明确的名分,而不是放在主语位置。

3.2 迁移时必须检查的 7 个改动点

这里是一批 Nano Banana 模板迁移时固定要检查的清单,按优先级排列:

序检查点迁移操作理由
1魔法前缀nano banana改成style anchor:开头段防止被新模型当成画面主体
2连接符号把逗号串改成换行或分号让模型拆出任务层级
3工具参数删除--ar、--q等参数新接口不兼容这些写法
4#标签把#golden hour改成文字句图像模型会把 # 后面的词画进画面
5负向词减到 2 到 3 个,并用正向描述补足过重的否定采样反而弄脏画面
6系列一致性同一主体的多张图固定共享一段 Subject 描述分次生成时主体不会漂移
7机位参数加上camera height,focal length防止“换机位”变成“换主体”

第 4 点很多人会忽略:上一代模型里#在绘图指令里承担“写出标题文字”的功能,如果#golden hour混进 Image Prompts,画面角落多出一行发光字体不是模型抽风,而是 # 被正确执行成了文字绘制指令。迁移到 GPT-5 时这种写法要彻底清理,#相关语法不再属于图像提示词的标准用法。

3.3 迁移实例:保持同一主角连续出三张图

批量应用场景里,最忌讳的是同一主角连续生成三张图,结果三张图三个人。下面这段是一个典型的迁移案例,从 GPT-4o 的单图提示升级成同一主角的三图提示:

# 迁移前,GPT-4o 单图 nano banana, fashion model, yellow raincoat, rainy night city street # 迁移后,GPT-5 三图连续应用 Subject: a fashion model wearing a yellow raincoat, photographed from behind. Environment: empty city street at rainy night, wet asphalt with reflections. Camera: 50mm lens, eye level 160cm, no dutch angle. Common constraints for all three frames: - do not change the raincoat color - neon signs in background should be blurred - model pose changes in each frame, coat stays the same

Subject:段是共享主体描述,三张图共用,模型每次生成时都会把这段作为最高优先级;Common constraints是共享约束段,专门控制色彩和背景这类容易被忽略的变量。逐帧变化只放在最后一行,比如“pose changes”。这样拆开后,连续生成时主体身份的漂移会大幅下降。配合后面要讲的批量脚本,把这段模板放到不同的会话里跑,就能明显看出固化首段的价值。

4. 避坑:Nano Banana 提示词照搬失效的 5 个现场

提示词最气人的是,同一条模板别人能用,你抄过来就翻车。下面五个现场来自跑图和帮同事排查时的常见情况,按“现象→原因→解决”写,方便直接对照。

4.1 把颗粒和细节叠多了,皮肤变鳄鱼皮

现象:提示词里同时出现film grain、high detail、sharp skin texture,人脸或陶瓷表面出现鳞片状纹理,脸颊泛着油腻的高频噪点。

原因:film grain和sharp skin texture共同指向“增加高频细节”,两个高频任务在模型内部互相叠加,等于把噪声和纹理一起放大。high detail这种全局词此时不是增强画质,而是把已经溢出的高频再推一层。

解决:把纹理描述收敛为一个词并加程度限制,我一般写soft genuine grain, do not enlarge pores。批量出图时,把纹理相关词固定成模板变量,不给每张图的单独提示词重复添加,避免累积。

4.2 全中文翻译后风格失效

现象:把整段 nanobanana 提示词翻译成中文,比如“纳米香蕉、电影感胶片、柔和阴影”,出图变成一种带柠檬黄的廉价滤镜感,和英文版完全不像。

原因:nano banana是在英文语料里和特定图片分布绑定出来的高频标签,中文环境里“香蕉”的词义先于风格锚点被激活,模型容易把它解读成水果画面;cinematic film still这类镜头词也没有中文对等的精确语义。

解决:保留英文风格锚点,内容描述可以写中文,但nano banana、film still、35mm这三个词不动。更稳妥的做法是整条模板的提示词主体用英文,因为图像模型在英文下的物体名识别更直接;没有强烈必要就不要整段中文化。

4.3 同样的提示词,连续两次结果根本不像

现象:同一句话两次生成,人物五官、光线角度都变了,看起来像两个批次,一开始容易怀疑是不是平台偷偷改了 prompt。

原因:图像生成每次请求都会重新采样初始噪声。除非显式固定seed(或复用上一张图做编辑),否则即使提示词完全相同,每次输出也都是独立采样。

解决:接口调用里固定 seed,并把 seed 作为 prompt 的配套元数据一起保存。对话场景里把首张图作为后续编辑的底板,用“修改这张图”而不是重新生成;连续出系列图时,这是最像后悔药的做法。固定 seed 并不保证 100% 相同,但能让对比在一个可控范围内进行。

4.4 在 GPT-5 模型上,nano banana 前缀直接生成一堆香蕉

现象:切到新版本图像模型后,只要提示词开头写nano banana,画面里就会出现真实香蕉,哪怕后面写的主体是“猫”或“茶壶”,香蕉仍会以某种形式混入,偶尔还成为整张图的焦点。

原因:新模型把nano banana当成实际名词,字面权重压过了风格权重;前缀从“风格锚点”变成了“主体词”。这是标签式提示词迁移时最常见的翻车现场,老模型把它当风格词,新模型更偏向字面理解。

解决:把前缀降级为描述性段落,放到style anchor:之后,明确告诉模型这是风格标签而不是画面元素。例如写成style anchor: low saturation, soft film grain, cinematic still — subject: a tabby cat。在 GPT-5 的 Image Prompts 里,nano banana不再适合放在句首当主语。

4.5 负向词写满 5 条之后,画面出现诡异的“半成品感”

现象:末尾加上no blur, no shadow, no reflection, no watermark, no text之后,画面边缘变灰,主体阴影消失,物体像贴图一样浮在背景上。

原因:负向词过多时,模型不是在做减法,而是把否定词当成独立语义来采样,结果是shadow真的被压掉,空间感也跟着消失。否定词和正向词在采样空间里互相抢权重,堆得越多,画面越容易往中间态坍缩。

解决:负向词控制在 2 到 3 个高频项,no watermark, no text, no over-sharpening是比较安全的组合。其余约束尽量转成正向描述:要阴影就写soft natural shadows,不要写no harsh shadows。这条规则在 GPT-4o 和 GPT-5 上同样适用,新模型表现更明显。

5. 再进一步:用一套小脚本给 Image Prompts 做批量校验

改提示词最忌讳单张看效果:今天调了一个词,出了一张好图就下结论,第二天批量跑 50 张,发现前 20 张全崩。批量校验的意义不是替代双眼,而是让效果可对比、可回滚。

5.1 最小批量校验脚本的写法

下面这套不算成品,而是一个可复制的最小框架。图像生成接口各家差异很大,先用一个抽象的发送函数占位,重点看批量用例的组织方式。

# prompt_check.py —— Image Prompts 批量校验的最小框架 import json import time def send_image_request(prompt: str, size: str = "1024x1024", seed: int = 20240601, n: int = 2) -> list[str]: """把 prompt 发送给图像生成服务,返回图片文件名列表。 具体实现依赖你用的平台,这里只给出约定。""" return ["out_a.png", "out_b.png"] def run_suite(cases: list[dict]) -> dict: report = [] for case in cases: t0 = time.time() files = send_image_request( case["prompt"], seed=case.get("seed", 20240601), n=case.get("n", 2) ) report.append({ "name": case["name"], "prompt": case["prompt"][:80], "files": files, "cost_sec": round(time.time() - t0, 2), }) return report if __name__ == "__main__": test_cases = [ { "name": "baseline-v1", "prompt": "nano banana, a teapot on a wooden desk, centered", "seed": 11, }, { "name": "negative-removed", "prompt": "a teapot on a wooden desk, soft matte finish", "seed": 11, }, ] print(json.dumps(run_suite(test_cases), ensure_ascii=False, indent=2))

有三个细节值得解释。第一是每个用例强制带seed,否则两次对比的随机基础不同,没法归因。第二是n=2,同一个 seed 出两张,便于发现低频翻车;两张都正常,说明这次改词的方向大概率安全。第三是cost_sec,图像生成按张算成本和时间,批量用例从 4 个到 20 个不等,留一个耗时字段就能估算批量跑一轮的预算。

prompt截断到 80 字符是方便在报告里快速定位用例;完整 prompt 应单独存进 JSON 文件,不要在终端里刷屏。脚本跑完后,真正要做的是人工验收。

5.2 人工验收与提示词版本管理

批量脚本只保证“能跑”,最终还得人看。我一般按四个维度给每张图打分,每项 1 到 5 分,低于 3 分直接判负。

评分项看什么
风格一致性是否延续胶片、低饱和、收敛光比的气质
主体保真茶壶还是茶壶,没有多出香蕉、马克杯等异物
限制词生效没有水印、没有文字、没有过度锐化
单张耗时平均出图时间是否在可接受范围

四项都过关后,把这版 prompt 存成带版本号的模板文件,比如nano-banana-teapot-v2.1.md,并在文件头注释:改了哪些词、当时的 seed、哪几张图是代表作。我自己的习惯是每次只改一个变量,从不一次改两个词,回滚时才能精确知道是哪一处改动破坏了风格。这个“一次只改一个变量”的做法,比堆词试错和反复重新生成都高效。

做提示词做到后面会发现,值钱的不是某一条咒语,而是手里有一套能验证、能回滚、能迁移的词料库。Nano Banana 提示词只是一个起点,把结构和排障方法拿走,你可以给任何风格建同样的一套配方。希望帮到你。

本文还有配套的精品资源,点击获取

返回列表