Gemini 图片生成提示词不需要写成关键词堆。更稳的方式是把它当成一份给设计师的创作简报:说明用途、主体、画面关系、风格、限制、输出尺寸和验收标准。这样既适合 AI Studio 里的手动创作,也适合开发者把提示词放进 API 工作流。
截至 2026-07-08,Google 的 Nano Banana image generation 文档把图片生成能力拆成多条模型路线:Nano Banana 2、Nano Banana Pro、Lite 和旧 Nano Banana。新代码应优先参考 Interactions API;如果要控制图片输出,应在 response_format 里设置 type: "image"、aspect_ratio 和 image_size。模型、价格、配额和可用性会变化,生产前要核对 Google 的 image generation、pricing 和 rate limits 文档。
| 你要完成什么 | 建议路线 |
|---|---|
| 快速创意草图 | 先用 Nano Banana 2 或 Lite,低成本多轮迭代 |
| 文字、品牌、复杂构图 | 评估 Nano Banana Pro / gemini-3-pro-image |
| 4K 交付图 | 明确 image_size: "4K",并按项目预算核对成本 |
| 参考图编辑 | 上传你有权使用的图片,用自然语言描述保留和修改项 |
| 批量生成 | 用固定提示词字段、队列和 Batch/Flex,而不是人工复制模板 |
| 中国开发者接入 | 官方路线优先;网关只作为支付、兼容接口或备用通道候选 |
先选模型,再写提示词
提示词写得再好,也要放在合适的模型和输出档位里。把“我要什么图”拆成“我要多快、多贵、多精确、多高分辨率”会更清楚。
| 模型 | 当前定位 | 提示词侧重点 |
|---|---|---|
gemini-3.1-flash-lite-image | 低成本、低延迟、大规模草图 | 简短明确、批量一致性、少参考图 |
gemini-3.1-flash-image | 通用图片生成和编辑 | 画面关系、参考图、多轮修改 |
gemini-3-pro-image | 专业资产、复杂指令、4K 和品牌一致性 | 交付用途、文字内容、布局、限制和验收标准 |
gemini-2.5-flash-image | 旧 Nano Banana 路线 | 旧项目兼容,新项目应评估迁移 |
如果你只是探索方向,不要一开始就写很重的 4K 专业 prompt。先用低成本模型生成 3 到 5 个方向,再把最有希望的方向升级到 Pro 或 4K,通常更省钱也更容易控制质量。
中文提示词的 7 个字段
一个可复用的中文提示词最好有固定字段,而不是每次凭感觉写一句话。
| 字段 | 要回答的问题 | 示例 |
|---|---|---|
| 用途 | 这张图最终放在哪里 | 电商主图、网页首屏、海报、封面、App 图标 |
| 主体 | 画面的中心对象是什么 | 一瓶玻璃护肤精华、一位虚构角色、一辆概念车 |
| 关系 | 主体和环境如何组织 | 居中、左侧留文案区、45 度俯拍、三分构图 |
| 风格 | 应该像什么视觉系统 | 产品摄影、3D 图标、扁平插画、水墨、电影海报 |
| 细节 | 哪些东西必须出现或不能变 | Logo 位置、包装文字、服装颜色、参考图人物特征 |
| 输出 | 横竖比例、尺寸、是否需要留白 | 16:9、4:5、1:1、4K、顶部留标题空间 |
| 验收 | 什么结果算失败 | 文字不能错、手部不能畸形、背景不能抢主体 |
可以直接按这个句式写:
hljs text为[用途]生成一张[比例/尺寸]图片。 主体是[主体描述],位于[构图关系]。 场景包含[环境和必要元素],整体风格是[视觉风格]。 必须保留[关键限制],不要出现[明确排除项]。 画面需要传达[情绪/品牌感],最终应适合[交付场景]。
示例:
hljs text为护肤品牌网页首屏生成一张 16:9 横版产品主视觉。 主体是一瓶透明玻璃精华液,位于画面右侧三分线位置。 场景是干净的白色浴室台面,左侧保留足够文案空间,光线柔和。 必须保留瓶身标签的清晰边界,不要出现其他品牌文字。 整体感觉高级、克制、安静,适合电商落地页首屏。
模板库
这些模板不是为了堆关键词,而是为了让你快速锁定画面任务。把方括号里的内容替换成自己的素材即可。
产品摄影
hljs text为[产品类型]生成一张[比例]电商主图。 产品是[材质/颜色/关键卖点],放在[场景]中。 使用[光线],背景[简洁/生活化/高端],突出[卖点]。 画面需要留出[文案区位置],不要加入无关品牌或多余文字。
网页首屏
hljs text为[产品/服务]生成一张网站首屏背景图。 画面右侧展示[主体],左侧留出标题和按钮空间。 整体风格是[行业气质],色彩不要过饱和。 图片应适合裁切到桌面和移动端,主体不能贴边。
App 图标
hljs text生成一个[功能/品牌]的 App 图标。 图形使用[主形状]表达[核心概念],配色为[主色]和[辅助色]。 图标需要在小尺寸下仍然清晰,不要包含细小文字。 背景简洁,边缘留有安全间距。
社交媒体竖图
hljs text为[平台]生成一张 4:5 竖版配图。 主体是[人物/产品/场景],位于画面中央偏上。 底部留出短标题空间,整体色彩适合移动端快速浏览。 不要出现密集文字,不要让背景抢走主体注意力。
海报和活动图
hljs text生成一张[活动主题]海报主视觉。 画面包含[核心人物/产品/符号],顶部预留标题区域,底部预留时间地点信息区域。 风格是[电影感/科技感/极简/复古]。 文字区域不要直接生成正文排版,只保留清晰的留白和层级。
信息图草案
hljs text生成一张用于解释[概念]的信息图草案。 画面分为[数量]个步骤,每个步骤用简单图标表达。 整体布局清晰,适合后期在设计工具中补充正式文字。 不要生成过多小字,重点是结构和视觉层级。
角色一致性
hljs text基于参考图中的虚构角色,生成[新场景/新姿势]。 保持角色的脸型、发型、服装主色和核心配饰不变。 改变[表情/动作/背景],画面风格保持一致。 不要改变角色年龄、身份或主要视觉特征。
局部编辑
hljs text编辑这张图片,只修改[具体区域]。 把[原元素]改成[目标元素],保持主体、光线、构图和背景不变。 不要改变[必须保留的区域]。 输出应看起来像原图自然拍摄结果,而不是贴图。
风格迁移
hljs text把这张图片转换为[目标风格]。 保留主体轮廓、构图关系和关键颜色,不改变人物身份或产品结构。 只改变材质、笔触、光影和整体视觉语言。 结果需要适合[交付用途]。
参考图合成
hljs text使用第一张图的[主体],第二张图的[场景/光线/材质],生成一张新的[比例]图片。 主体要自然融入场景,透视、阴影和色温一致。 不要复制参考图中的无关背景元素。
API 中怎么写提示词
新代码建议使用 Interactions API。下面是最小 Python 示例,重点是把自然语言 prompt 和输出控制分开。
hljs pythonfrom google import genai
import base64
client = genai.Client()
prompt = """
为一款智能笔记 App 生成 16:9 网站首屏图。
画面右侧是一台平板电脑,屏幕上是干净的笔记界面。
左侧保留标题和按钮空间,整体风格克制、专业、明亮。
不要出现真实品牌标志,不要生成密集小字。
"""
interaction = client.interactions.create(
model="gemini-3.1-flash-image",
input=prompt,
response_format={
"type": "image",
"aspect_ratio": "16:9",
"image_size": "2K",
},
)
if interaction.output_image:
with open("hero.png", "wb") as f:
f.write(base64.b64decode(interaction.output_image.data))
如果要生成 4K 专业资产,可以把模型换成 gemini-3-pro-image,并把 image_size 改成 4K。4K 的实际成本、像素表和 Batch/Flex 边界可以参考 Gemini 4K 图片 API 指南。
参考图和多轮修改
参考图提示词的核心不是“模仿这张图”,而是说明哪些部分要保留、哪些部分要改。
更稳的写法:
hljs text保留参考图中产品的瓶身形状、标签位置和透明玻璃材质。 把背景改成浅灰色摄影棚,增加柔和反光和右侧轮廓光。 不要改变瓶身比例,不要替换标签文字,不要加入其他产品。 输出为 1:1 方图,适合电商列表页。
多轮编辑时,每一轮只改一个主要目标。例如第一轮定构图,第二轮改光线,第三轮处理文字区域。一次要求模型“改背景、换风格、加文字、修手、换颜色”会增加失控概率,也让失败原因更难排查。
成本和配额边界
提示词指南不应该承诺固定免费额度、固定速度或固定成功率。Gemini API 的配额按 project 应用,不按 API key 应用;图片模型还可能受到图片相关限制、spend limit 和模型容量影响。
上线前至少核对:
| 项目 | 怎么核对 |
|---|---|
| 模型 ID | 以当前官方文档和项目实际可用模型为准 |
| 输出尺寸 | 1K、2K、4K 的 token 和价格不同 |
| 调用方式 | Standard、Batch、Flex、Priority 的价格和延迟不同 |
| 429 | 看 project 级 RPM/TPM/RPD/IPM 和 spend limit |
| 网关 | 看当前控制台模型、尺寸、扣费、错误日志和服务条款 |
| 数据 | 用户图片、品牌资产、人物图是否适合经过第三方路线 |
如果你要评估第三方网关,把它当成“付款、兼容接口或备用通道”来验证,而不是当成官方事实来源。路线选择可以看 Nano Banana Pro API 怎么选。
常见失败和修正
| 问题 | 常见原因 | 修正方式 |
|---|---|---|
| 图片没有按用途构图 | prompt 只描述主体,没有说明交付场景 | 加上网页首屏、海报、电商主图等用途 |
| 文字区域混乱 | 要求模型直接排大量文字 | 让模型保留标题区,正式文字后期排版 |
| 主体变形 | 参考图限制不清楚 | 明确哪些特征必须保留 |
| 风格不稳定 | 一次塞入太多风格词 | 只保留一个主风格和一两个辅助约束 |
| 成本过高 | 所有草图都用 4K | 先 1K/2K 迭代,定稿后升到 4K |
| 频繁 429 | 并发和尺寸没有控制 | 加队列、退避、降尺寸或使用 Batch/Flex |
FAQ
中文提示词可以直接用吗?
可以。Google 文档把 zh-CN 列在图像生成表现较好的语言范围里。不要为了“看起来更专业”硬翻译成英文;如果你的业务语境、品牌词和交付人群都是中文,中文 prompt 反而更容易表达细节。
提示词里写“4K”就会生成 4K 吗?
不一定。提示词里的“4K”只是自然语言要求;API 输出尺寸要用 response_format.image_size 控制。手动产品里也要看当前界面支持的输出档位。
一次应该生成几张?
开发流程上,建议先少量多轮,而不是一次批量生成很多张。先确认构图和风格,再扩大批量。API 批量任务要受配额、成本和失败重试策略约束。
能不能生成真实人物或名人图?
要谨慎。用户上传、真实人物、肖像、品牌和版权素材都涉及权利和安全边界。只上传你有权使用的图片,不要生成欺骗、骚扰、侵权或绕过安全限制的内容。
为什么图片里文字不稳定?
图片模型可以处理文字,但大量小字和复杂排版仍然容易出错。更稳的做法是先让模型生成有留白和层级的视觉草案,再在设计工具或前端里排正式文字。
网关路线可以直接替代官方吗?
不能。网关可以降低支付和接入摩擦,但模型覆盖、价格、失败扣费、延迟和数据边界都要用当前账户实测。涉及敏感素材或企业合规时,优先评估官方或企业路线。
上手顺序
- 先用 7 个字段写一版中文 prompt。
- 用低成本模型生成 3 到 5 个方向。
- 选一个方向做两到三轮编辑,每轮只改一个主要目标。
- 需要专业交付时再升级到 Pro、2K 或 4K。
- 记录模型、尺寸、prompt、参考图、成本和失败原因,方便复现。
好的 Gemini 图片提示词不是堆“高清、电影感、商业级”这些形容词,而是把创作任务讲清楚。用途、主体、构图、限制和验收标准越明确,模型越像在执行设计 brief,而不是猜测你想要什么。



