AI图片生成15分钟

Gemini 图片生成提示词指南:中文结构、模板和 API 边界

面向中文创作者和开发者的 Gemini 图片生成提示词指南:当前 Nano Banana 模型选择、中文提示词结构、可复用模板、参考图编辑、Interactions API 示例、成本和第三方网关核对边界。

Yingtu AI Editorial
Yingtu AI Editorial
Gemini image workflow research
2026年1月21日
最后更新 2026年7月8日
15分钟
Gemini image prompt guide for Chinese prompts, model choice, API settings, reference images, and production validation
yingtu.ai

文章目录

这篇文章暂无目录结构

Gemini 图片生成提示词不需要写成关键词堆。更稳的方式是把它当成一份给设计师的创作简报:说明用途、主体、画面关系、风格、限制、输出尺寸和验收标准。这样既适合 AI Studio 里的手动创作,也适合开发者把提示词放进 API 工作流。

截至 2026-07-08,Google 的 Nano Banana image generation 文档把图片生成能力拆成多条模型路线:Nano Banana 2、Nano Banana Pro、Lite 和旧 Nano Banana。新代码应优先参考 Interactions API;如果要控制图片输出,应在 response_format 里设置 type: "image"aspect_ratioimage_size。模型、价格、配额和可用性会变化,生产前要核对 Google 的 image generationpricingrate limits 文档。

你要完成什么建议路线
快速创意草图先用 Nano Banana 2 或 Lite,低成本多轮迭代
文字、品牌、复杂构图评估 Nano Banana Pro / gemini-3-pro-image
4K 交付图明确 image_size: "4K",并按项目预算核对成本
参考图编辑上传你有权使用的图片,用自然语言描述保留和修改项
批量生成用固定提示词字段、队列和 Batch/Flex,而不是人工复制模板
中国开发者接入官方路线优先;网关只作为支付、兼容接口或备用通道候选

先选模型,再写提示词

提示词写得再好,也要放在合适的模型和输出档位里。把“我要什么图”拆成“我要多快、多贵、多精确、多高分辨率”会更清楚。

模型当前定位提示词侧重点
gemini-3.1-flash-lite-image低成本、低延迟、大规模草图简短明确、批量一致性、少参考图
gemini-3.1-flash-image通用图片生成和编辑画面关系、参考图、多轮修改
gemini-3-pro-image专业资产、复杂指令、4K 和品牌一致性交付用途、文字内容、布局、限制和验收标准
gemini-2.5-flash-image旧 Nano Banana 路线旧项目兼容,新项目应评估迁移

如果你只是探索方向,不要一开始就写很重的 4K 专业 prompt。先用低成本模型生成 3 到 5 个方向,再把最有希望的方向升级到 Pro 或 4K,通常更省钱也更容易控制质量。

中文提示词的 7 个字段

一个可复用的中文提示词最好有固定字段,而不是每次凭感觉写一句话。

字段要回答的问题示例
用途这张图最终放在哪里电商主图、网页首屏、海报、封面、App 图标
主体画面的中心对象是什么一瓶玻璃护肤精华、一位虚构角色、一辆概念车
关系主体和环境如何组织居中、左侧留文案区、45 度俯拍、三分构图
风格应该像什么视觉系统产品摄影、3D 图标、扁平插画、水墨、电影海报
细节哪些东西必须出现或不能变Logo 位置、包装文字、服装颜色、参考图人物特征
输出横竖比例、尺寸、是否需要留白16:9、4:5、1:1、4K、顶部留标题空间
验收什么结果算失败文字不能错、手部不能畸形、背景不能抢主体

可以直接按这个句式写:

hljs text
为[用途]生成一张[比例/尺寸]图片。
主体是[主体描述],位于[构图关系]。
场景包含[环境和必要元素],整体风格是[视觉风格]。
必须保留[关键限制],不要出现[明确排除项]。
画面需要传达[情绪/品牌感],最终应适合[交付场景]。

示例:

hljs text
为护肤品牌网页首屏生成一张 16:9 横版产品主视觉。
主体是一瓶透明玻璃精华液,位于画面右侧三分线位置。
场景是干净的白色浴室台面,左侧保留足够文案空间,光线柔和。
必须保留瓶身标签的清晰边界,不要出现其他品牌文字。
整体感觉高级、克制、安静,适合电商落地页首屏。

模板库

这些模板不是为了堆关键词,而是为了让你快速锁定画面任务。把方括号里的内容替换成自己的素材即可。

产品摄影

hljs text
为[产品类型]生成一张[比例]电商主图。
产品是[材质/颜色/关键卖点],放在[场景]中。
使用[光线],背景[简洁/生活化/高端],突出[卖点]。
画面需要留出[文案区位置],不要加入无关品牌或多余文字。

网页首屏

hljs text
为[产品/服务]生成一张网站首屏背景图。
画面右侧展示[主体],左侧留出标题和按钮空间。
整体风格是[行业气质],色彩不要过饱和。
图片应适合裁切到桌面和移动端,主体不能贴边。

App 图标

hljs text
生成一个[功能/品牌]的 App 图标。
图形使用[主形状]表达[核心概念],配色为[主色]和[辅助色]。
图标需要在小尺寸下仍然清晰,不要包含细小文字。
背景简洁,边缘留有安全间距。

社交媒体竖图

hljs text
为[平台]生成一张 4:5 竖版配图。
主体是[人物/产品/场景],位于画面中央偏上。
底部留出短标题空间,整体色彩适合移动端快速浏览。
不要出现密集文字,不要让背景抢走主体注意力。

海报和活动图

hljs text
生成一张[活动主题]海报主视觉。
画面包含[核心人物/产品/符号],顶部预留标题区域,底部预留时间地点信息区域。
风格是[电影感/科技感/极简/复古]。
文字区域不要直接生成正文排版,只保留清晰的留白和层级。

信息图草案

hljs text
生成一张用于解释[概念]的信息图草案。
画面分为[数量]个步骤,每个步骤用简单图标表达。
整体布局清晰,适合后期在设计工具中补充正式文字。
不要生成过多小字,重点是结构和视觉层级。

角色一致性

hljs text
基于参考图中的虚构角色,生成[新场景/新姿势]。
保持角色的脸型、发型、服装主色和核心配饰不变。
改变[表情/动作/背景],画面风格保持一致。
不要改变角色年龄、身份或主要视觉特征。

局部编辑

hljs text
编辑这张图片,只修改[具体区域]。
把[原元素]改成[目标元素],保持主体、光线、构图和背景不变。
不要改变[必须保留的区域]。
输出应看起来像原图自然拍摄结果,而不是贴图。

风格迁移

hljs text
把这张图片转换为[目标风格]。
保留主体轮廓、构图关系和关键颜色,不改变人物身份或产品结构。
只改变材质、笔触、光影和整体视觉语言。
结果需要适合[交付用途]。

参考图合成

hljs text
使用第一张图的[主体],第二张图的[场景/光线/材质],生成一张新的[比例]图片。
主体要自然融入场景,透视、阴影和色温一致。
不要复制参考图中的无关背景元素。

API 中怎么写提示词

新代码建议使用 Interactions API。下面是最小 Python 示例,重点是把自然语言 prompt 和输出控制分开。

hljs python
from google import genai
import base64

client = genai.Client()

prompt = """
为一款智能笔记 App 生成 16:9 网站首屏图。
画面右侧是一台平板电脑,屏幕上是干净的笔记界面。
左侧保留标题和按钮空间,整体风格克制、专业、明亮。
不要出现真实品牌标志,不要生成密集小字。
"""

interaction = client.interactions.create(
    model="gemini-3.1-flash-image",
    input=prompt,
    response_format={
        "type": "image",
        "aspect_ratio": "16:9",
        "image_size": "2K",
    },
)

if interaction.output_image:
    with open("hero.png", "wb") as f:
        f.write(base64.b64decode(interaction.output_image.data))

如果要生成 4K 专业资产,可以把模型换成 gemini-3-pro-image,并把 image_size 改成 4K。4K 的实际成本、像素表和 Batch/Flex 边界可以参考 Gemini 4K 图片 API 指南

参考图和多轮修改

参考图提示词的核心不是“模仿这张图”,而是说明哪些部分要保留、哪些部分要改。

更稳的写法:

hljs text
保留参考图中产品的瓶身形状、标签位置和透明玻璃材质。
把背景改成浅灰色摄影棚,增加柔和反光和右侧轮廓光。
不要改变瓶身比例,不要替换标签文字,不要加入其他产品。
输出为 1:1 方图,适合电商列表页。

多轮编辑时,每一轮只改一个主要目标。例如第一轮定构图,第二轮改光线,第三轮处理文字区域。一次要求模型“改背景、换风格、加文字、修手、换颜色”会增加失控概率,也让失败原因更难排查。

成本和配额边界

提示词指南不应该承诺固定免费额度、固定速度或固定成功率。Gemini API 的配额按 project 应用,不按 API key 应用;图片模型还可能受到图片相关限制、spend limit 和模型容量影响。

上线前至少核对:

项目怎么核对
模型 ID以当前官方文档和项目实际可用模型为准
输出尺寸1K、2K、4K 的 token 和价格不同
调用方式Standard、Batch、Flex、Priority 的价格和延迟不同
429看 project 级 RPM/TPM/RPD/IPM 和 spend limit
网关看当前控制台模型、尺寸、扣费、错误日志和服务条款
数据用户图片、品牌资产、人物图是否适合经过第三方路线

如果你要评估第三方网关,把它当成“付款、兼容接口或备用通道”来验证,而不是当成官方事实来源。路线选择可以看 Nano Banana Pro API 怎么选

常见失败和修正

问题常见原因修正方式
图片没有按用途构图prompt 只描述主体,没有说明交付场景加上网页首屏、海报、电商主图等用途
文字区域混乱要求模型直接排大量文字让模型保留标题区,正式文字后期排版
主体变形参考图限制不清楚明确哪些特征必须保留
风格不稳定一次塞入太多风格词只保留一个主风格和一两个辅助约束
成本过高所有草图都用 4K先 1K/2K 迭代,定稿后升到 4K
频繁 429并发和尺寸没有控制加队列、退避、降尺寸或使用 Batch/Flex

FAQ

中文提示词可以直接用吗?

可以。Google 文档把 zh-CN 列在图像生成表现较好的语言范围里。不要为了“看起来更专业”硬翻译成英文;如果你的业务语境、品牌词和交付人群都是中文,中文 prompt 反而更容易表达细节。

提示词里写“4K”就会生成 4K 吗?

不一定。提示词里的“4K”只是自然语言要求;API 输出尺寸要用 response_format.image_size 控制。手动产品里也要看当前界面支持的输出档位。

一次应该生成几张?

开发流程上,建议先少量多轮,而不是一次批量生成很多张。先确认构图和风格,再扩大批量。API 批量任务要受配额、成本和失败重试策略约束。

能不能生成真实人物或名人图?

要谨慎。用户上传、真实人物、肖像、品牌和版权素材都涉及权利和安全边界。只上传你有权使用的图片,不要生成欺骗、骚扰、侵权或绕过安全限制的内容。

为什么图片里文字不稳定?

图片模型可以处理文字,但大量小字和复杂排版仍然容易出错。更稳的做法是先让模型生成有留白和层级的视觉草案,再在设计工具或前端里排正式文字。

网关路线可以直接替代官方吗?

不能。网关可以降低支付和接入摩擦,但模型覆盖、价格、失败扣费、延迟和数据边界都要用当前账户实测。涉及敏感素材或企业合规时,优先评估官方或企业路线。

上手顺序

  1. 先用 7 个字段写一版中文 prompt。
  2. 用低成本模型生成 3 到 5 个方向。
  3. 选一个方向做两到三轮编辑,每轮只改一个主要目标。
  4. 需要专业交付时再升级到 Pro、2K 或 4K。
  5. 记录模型、尺寸、prompt、参考图、成本和失败原因,方便复现。

好的 Gemini 图片提示词不是堆“高清、电影感、商业级”这些形容词,而是把创作任务讲清楚。用途、主体、构图、限制和验收标准越明确,模型越像在执行设计 brief,而不是猜测你想要什么。

文章标签

分享这篇文章

XTelegram