AI 生图与科研配图🔗
关键词: AI 生图, 科研模式图, Nano Banana, Gemini 图像生成, GPT Image, FLUX, Midjourney, Seedream, 提示词优化, Graphical Abstract
难度: ⭐⭐
预计阅读时间: 35 分钟
最后更新: 2026-04-09
本章导读🔗
2025-2026 年,AI 图像生成迎来井喷式爆发。Google 的 Nano Banana 系列(Gemini 原生图像生成)、OpenAI 的 GPT Image 1.5、Black Forest Labs 的 FLUX.2 系列以及字节跳动的 Seedream 等模型轮番刷新榜单。在 2026 年 4 月的 Image Arena 排行榜上,这些模型在文字渲染、指令遵循、画面质量方面已经达到了惊人的水平。
⚠️ 注意: 早期广为流传的"GPT-4o 图像生成"已于 2026-02 随 GPT-4o 退役而下线。当前 ChatGPT 使用的是 GPT Image 1.5 模型;而 Google Gemini 的原生图像生成(内部代号 Nano Banana 系列)在免费用户中也广泛可用,是当前性价比最高的选择。
对科研人员来说,AI 生图最重要的应用场景是:
- 科研模式图(Schematic / Mechanism Diagram):论文中的机制示意图、信号通路图
- Graphical Abstract:期刊投稿要求的图形化摘要
- 演示配图:组会 PPT、学术海报的插图
- 概念可视化:将抽象科学概念转化为直观图像
本章将系统介绍当前最强的 AI 生图工具、科研场景下的最佳实践,以及提示词优化工作流——如何用大模型帮你写出完美的提示词,再交给专业生图模型生成高质量图片。
1. AI 生图工具全景🔗
1.1 Image Arena 排行榜(2026 年 4 月)🔗
以下是 Artificial Analysis Image Arena(基于用户盲测投票的 ELO 排名)的前 12 名:
| 排名 | 模型 | 背后产品 | ELO | 提供商 | 大致费用 |
|---|---|---|---|---|---|
| 1 | GPT Image 1.5 (high) | ChatGPT 图像生成 | 1265 | OpenAI | ~$133/千张 |
| 2 | Nano Banana 2 | Gemini 3.1 Flash 图像 | 1257 | ~$67/千张 | |
| 3 | Nano Banana Pro | Gemini 3 Pro 图像 | 1215 | ~$134/千张 | |
| 4 | FLUX.2 [max] | FLUX 旗舰 | 1201 | Black Forest Labs | ~$70/千张 |
| 5 | Seedream 4.0 | 字节跳动生图 | 1185 | BytePlus | ~$30/千张 |
| 6 | FLUX.2 [pro] | FLUX 专业版 | 1182 | Black Forest Labs | ~$30/千张 |
| 7 | FLUX.2 [flex] | FLUX 灵活版 | 1181 | Black Forest Labs | ~$60/千张 |
| 8 | Seedream 4.5 | 字节跳动生图升级 | 1172 | BytePlus | ~$40/千张 |
| 9 | Grok Imagine | xAI 生图 | 1171 | xAI | ~$20/千张 |
| 10 | Imagen 4 Ultra | Google 专用图像模型 | 1169 | Google DeepMind | ~$60/千张 |
| 11 | Nano Banana | Gemini 2.5 Flash 图像 | 1164 | ~$39/千张 | |
| 12 | FLUX.2 [dev] Turbo | FLUX 开源快速版 | 1164 | fal.ai | ~$8/千张 |
名词解释: - Nano Banana 是 Google Gemini 模型图像生成功能在 Image Arena 中的代号。Nano Banana Pro = Gemini 3 Pro 图像生成,Nano Banana 2 = Gemini 3.1 Flash 图像生成。 - GPT Image 1.5 是 OpenAI 2026 年推出的最新图像生成模型,取代了已退役的 GPT-4o 图像生成。 - Seedream 是字节跳动(ByteDance)旗下的图像生成模型。
1.2 主流工具速查🔗
| 工具 | 核心优势 | 适合场景 | 访问方式 | 费用 |
|---|---|---|---|---|
| Gemini 图像生成(Nano Banana 系列) | 免费使用、多轮对话迭代、文字渲染强 | 科研配图首选:模式图、Graphical Abstract | gemini.google.com / AI Studio | 免费(Gemini)/ API 计费 |
| GPT Image 1.5 | ELO 榜首、指令遵循极强、多轮迭代 | 复杂场景、精确控制 | ChatGPT 网页/APP | ChatGPT Plus/Pro |
| Midjourney V7 | 画面美感顶级、风格化极强 | 演示配图、概念可视化、海报插图 | 网页版 midjourney.com | 按月订阅 |
| FLUX.2 系列 | 开源可商用、速度快、LoRA 微调灵活 | 批量生图、定制风格、本地部署 | API / 本地部署 | API 按量计费 / 本地免费 |
| Seedream 4.x | API 价格极低、效果好 | 批量生图、预算敏感场景 | BytePlus API | ~$30/千张 |
| Imagen 4 | Google 专用图像模型、2K 分辨率 | 超高分辨率需求 | Google AI Studio / Vertex AI | API 计费 |
| Stable Diffusion 3.5 | 完全开源、社区生态强大 | 本地部署、深度定制 | 本地运行 | 免费 |
1.3 科研场景推荐选择🔗
| 科研场景 | 首选工具 | 原因 |
|---|---|---|
| 论文模式图 | Gemini(Nano Banana Pro) | 免费、文字标注精确、可多轮迭代 |
| Graphical Abstract | Gemini / GPT Image 1.5 | Gemini 免费好用;GPT Image 质量最顶 |
| PPT 插图 | Midjourney / Gemini | Midjourney 美感强、Gemini 快速免费 |
| 概念示意图 | Gemini / GPT Image 1.5 | 理解科学概念,文字+图像配合好 |
| 批量同风格图 | FLUX.2(LoRA 微调)/ Seedream | 一次训练批量生成 / API 批量调用 |
| 超高分辨率 | Imagen 4 Ultra | 支持 2K 分辨率直出 |
| 涉密/数据敏感 | Stable Diffusion / FLUX.2 Dev(本地) | 数据不出本地 |
重要提醒: 多数学术期刊(如 Nature、Science)允许使用 AI 生成的图像,但要求在论文中声明使用了 AI 工具及具体用途。请查阅目标期刊的投稿指南。
2. Gemini 原生图像生成(Nano Banana 系列)⭐⭐⭐🔗
2.1 为什么推荐 Gemini 作为科研配图首选?🔗
Google Gemini 3 系列模型内置了原生图像生成能力。在 Image Arena 排行榜上,Gemini 家族有三个模型进入前 12(Nano Banana Pro #3、Nano Banana 2 #2、Nano Banana #11),且免费用户即可使用,是科研配图性价比最高的选择:
- 免费使用:通过 gemini.google.com 对话即可生成图像,无需付费订阅
- 多轮对话迭代:生成一张图后可以说"把标注字体放大""配色换成蓝绿色系",模型在对话中保持图像一致性
- 精确文字渲染:Nano Banana Pro 在文字渲染准确率方面表现优秀,科研配图中的标注不易出错
- 原生多模态:同一个模型同时理解文字和生成图像,能利用对话中的科学知识理解你的需求
- 上传参考图:上传一张草图或现有图片,AI 在此基础上生成
模型选择: - Gemini 3 Pro(对应 Nano Banana Pro):质量最高,适合精细科研配图 - Gemini 3.1 Flash(对应 Nano Banana 2):速度极快,ELO 排名 #2,日常生图首选 - 在 Gemini 网页端一般默认使用最新模型,无需手动选择
2.2 科研配图实操🔗
示例 1:生成信号通路模式图
提示词(在 Gemini 中直接输入):
请生成一张 MAPK/ERK 信号通路的科研模式图,白色背景,风格简洁专业。
要求:
- 从细胞膜受体(RTK)开始,经过 Ras → Raf → MEK → ERK 的级联
- 每个蛋白用不同颜色的圆角矩形表示,标注英文名称
- 用箭头表示激活关系,用 T 形符号表示抑制
- 最终展示 ERK 进入细胞核调控转录因子
- 标注 2-3 个关键抑制剂(如 Sorafenib 作用于 Raf)
- 整体风格类似 Cell Signaling Technology 的通路图
- 图像尺寸 16:9
示例 2:生成 Graphical Abstract
提示词:
请为以下论文生成一张 Graphical Abstract:
论文主题:利用深度学习预测蛋白质-配体结合亲和力
关键发现:新模型比传统对接方法准确率提升 35%
要求:
- 左侧展示蛋白质 3D 结构 + 小分子配体
- 中间是一个深度学习神经网络的示意图
- 右侧是预测结果(结合亲和力评分)
- 整体使用蓝白配色,专业简洁
- 尺寸按照目标期刊要求(正方形 1200x1200)
- 不要太多文字,关键位置用英文标注
2.3 多轮迭代技巧🔗
Gemini 图像生成的杀手级功能是多轮对话迭代:
- 先生成初版 → 看整体构图是否满意
- "把背景改成浅灰色" → 微调颜色
- "蛋白质的标注字体放大一点" → 调整细节
- "在右下角加上比例尺" → 补充元素
- "整体风格再扁平化一些,参考这张图的风格"(上传参考图)→ 风格调整
技巧: 每次只改一个方面,不要一次提太多修改要求,否则模型可能偏离之前的内容。
3. GPT Image 1.5(ChatGPT 图像生成)🔗
3.1 核心能力🔗
GPT Image 1.5 是 OpenAI 于 2026 年推出的最新图像生成模型,ELO 排名第 1(1265 分),取代了 2025 年 3 月发布的 GPT-4o 图像生成。在 ChatGPT 中使用图像生成功能时,背后调用的就是这个模型。
核心优势:
- ELO 排行榜第一:在指令遵循、画面质量、文字渲染等综合评测中拿下榜首
- 精确文字渲染:能在图像中准确生成文字标注,这在科研配图中极为关键
- 多轮对话迭代:与 Gemini 类似,支持在对话中逐步修改
- 上下文理解:能利用对话中的科学知识理解你的需求
- 指令遵循:能同时处理包含 10-20 个不同物体的复杂场景
3.2 GPT Image 1.5 vs Gemini 图像生成🔗
| 对比维度 | GPT Image 1.5 | Gemini(Nano Banana Pro) |
|---|---|---|
| ELO 排名 | #1(1265) | #3(1215) |
| 费用 | ChatGPT Plus $20/月 | 免费 |
| 文字渲染 | 极强 | 强 |
| 多轮迭代 | ✅ | ✅ |
| 中文提示词 | 好 | 好 |
| 访问便利 | 需付费 | 免费直接用 |
建议: 日常科研配图用 Gemini(免费且效果好);需要最高质量或 Gemini 搞不定时用 GPT Image 1.5。
4. 提示词优化工作流 ⭐⭐⭐🔗
4.1 核心策略:LLM 写提示词 → 专业模型出图🔗
这是当前最高效的 AI 生图工作流:
- 用 ChatGPT / Claude / Gemini 等大模型优化提示词——它们擅长理解你的模糊需求并转化为精确的、生图模型友好的提示词
- 用专业生图模型(Midjourney / FLUX)执行生图——它们的图像风格化能力极强
当然,如果你直接用 Gemini 或 ChatGPT 生图(它们自己就能出图),这个"两步法"就不是必须的。但对于 Midjourney 和 FLUX 这类只接受提示词输入的模型,用 LLM 帮你写提示词效果远好于自己写。
4.2 让 ChatGPT/Gemini 帮你写 Midjourney 提示词🔗
你是一个专业的 Midjourney 提示词工程师。我需要生成一张科研论文用的模式图。
我的需求:
[描述你想要的图片]
请帮我生成一个优化后的 Midjourney 提示词,要求:
1. 使用英文
2. 包含风格描述(如 flat design, scientific illustration, minimalist)
3. 包含颜色方案(适合科研论文的配色)
4. 包含质量参数(如 --ar 16:9 --v 7 --s 200)
5. 避免过于复杂的场景,保持简洁专业
4.3 让 Claude 帮你写 FLUX 提示词🔗
你是一个专业的 FLUX 图像生成提示词专家。我需要为科研论文生成一张配图。
我的需求:
[描述你想要的图片]
请帮我生成一个 FLUX 友好的提示词:
1. 英文描述
2. 详细但有条理(先主题,再风格,再细节)
3. 指定风格关键词:scientific illustration, clean design, white background
4. 指定质量关键词:high resolution, vector graphics style, print quality
4.4 Gemini / ChatGPT 直接生图的提示词模板🔗
Gemini 和 ChatGPT 图像生成的提示词更灵活,因为它们理解自然语言。但好的结构仍然重要:
请生成一张 [图片类型] 的图像。
主题:[具体描述]
风格:[扁平化 / 手绘 / 写实 / 科研插图风格 等]
配色:[蓝白 / 暖色 / 指定配色方案]
尺寸:[16:9 / 正方形 / 指定像素]
背景:[白色 / 透明 / 浅灰]
文字标注:[需要哪些文字标注及位置]
参考:[参考某个风格 / 上传参考图]
要求:
- 线条清晰,适合印刷
- 标注字体清晰可读
- 整体专业简洁
4.5 提示词常用修饰词速查🔗
| 目标 | 英文关键词 | 说明 |
|---|---|---|
| 科研插图风格 | scientific illustration, schematic diagram, medical illustration | 专业严谨 |
| 扁平设计 | flat design, vector style, minimal, clean | 简洁现代 |
| 手绘风格 | hand-drawn, sketch style, watercolor | 软性表达 |
| 照片级真实 | photorealistic, hyper-realistic, cinematic lighting | 逼真质感 |
| 白色背景 | white background, isolated, clean background | 论文用图 |
| 高清质量 | high resolution, 4K, print quality, crisp details | 印刷质量 |
| 透视示意 | cross-section, cutaway view, exploded view | 剖面/拆解 |
| 流程图 | flowchart, pipeline diagram, workflow | 流程展示 |
| 分子结构 | molecular structure, protein structure, ball-and-stick model | 化学/生物 |
5. Midjourney 科研配图指南🔗
5.1 基础设置🔗
- 访问 midjourney.com 注册账号
- 进入创作界面
- 建议使用 V7 模型(默认最新版)
5.2 科研配图提示词模板🔗
通用科研模式图:
Scientific schematic diagram of [主题], flat design style,
clean white background, professional color palette using
blue and teal tones, labeled components in English,
arrows showing relationships, high resolution,
print quality --ar 16:9 --v 7 --s 100
生物学机制图:
Detailed biological mechanism diagram showing [机制],
medical illustration style, cell membrane cross-section,
protein complexes labeled in English, phosphorylation
cascades with directional arrows, professional scientific
color scheme, clean layout --ar 16:9 --v 7 --s 150
Graphical Abstract 模板:
Clean graphical abstract for a scientific paper about [主题],
left-to-right workflow layout, minimalist flat design,
key findings highlighted, professional scientific illustration,
blue-white color scheme, no excessive text,
high resolution --ar 1:1 --v 7 --s 200
5.3 重要参数说明🔗
| 参数 | 作用 | 科研推荐值 |
|---|---|---|
--ar | 宽高比 | 16:9(海报/PPT);1:1(Graphical Abstract);3:4(期刊配图) |
--v | 模型版本 | 7(最新) |
--s | 风格化程度 | 100-200(过高会太艺术化) |
--q | 质量 | 1(默认)或 2(更精细) |
--no | 排除元素 | --no text, watermark(排除不需要的元素) |
6. FLUX.2 与 Seedream:API/开源生图🔗
6.1 FLUX.2 系列速览🔗
FLUX 是 Black Forest Labs(Stable Diffusion 原作者团队创办)推出的下一代图像生成模型:
| 模型 | 定位 | 特点 |
|---|---|---|
| FLUX.2 [max] | 旗舰(ELO #4) | 最高保真度,适合最终出版 |
| FLUX.2 [pro] | 专业(ELO #6) | 均衡质量与速度,性价比高 |
| FLUX.2 [flex] | 灵活(ELO #7) | 支持多种控制条件 |
| FLUX.2 [dev] Turbo | 开源快速(ELO #12) | 开源权重,支持 LoRA 微调,速度极快 |
| FLUX Kontext | 编辑 | 自然语言编辑已有图片 |
6.2 FLUX Python API 调用示例🔗
import replicate
# 使用 FLUX 2 Pro 生成科研配图
output = replicate.run(
"black-forest-labs/flux-2-pro",
input={
"prompt": "Scientific schematic diagram of CRISPR-Cas9 gene editing mechanism, "
"clean white background, flat design, labeled components, "
"professional blue-teal color scheme, high resolution",
"width": 1920,
"height": 1080,
"num_inference_steps": 50,
"guidance_scale": 7.5
}
)
print(output)
6.3 LoRA 微调:统一风格批量生图🔗
如果你的论文需要多张风格一致的配图,可以用 FLUX LoRA 微调:
- 准备 10-20 张目标风格的参考图(如你实验室以往论文的配图风格)
- 使用 FLUX Dev + LoRA 训练
- 之后所有生图自动保持统一风格
这在准备系列论文或实验室标准化配图时特别有用。
6.4 Seedream(字节跳动)🔗
Seedream 是字节跳动推出的图像生成模型,在 Image Arena 排行榜上 Seedream 4.0 排名 #5(ELO 1185),API 价格极低(约 $30/千张),适合大批量生图场景:
- Seedream 4.0:ELO 1185,综合质量接近 FLUX.2 [max]
- Seedream 4.5:ELO 1172,更新版本但评分略低
- 通过 BytePlus API 调用(字节跳动的海外云服务)
- 对中文场景支持友好
适用场景: 需要大批量生图且预算有限时,Seedream 是极具竞争力的选择。
7. 科研配图的注意事项与伦理🔗
7.1 学术伦理红线🔗
| 可以做 ✅ | 不可以做 ❌ |
|---|---|
| 用 AI 生成示意图、模式图 | 用 AI 伪造/修改实验数据图 |
| 用 AI 生成 Graphical Abstract | 用 AI 生成虚假的显微镜/Western Blot 图 |
| 用 AI 辅助配色和排版 | 用 AI 生成"看起来像真实实验结果"的图 |
| 在论文中声明使用了 AI | 不声明 AI 参与 |
7.2 常见问题🔗
Q:AI 生成的模式图精度够用吗?
A:对于 Graphical Abstract 和 PPT 配图完全够用。但如果是精确的信号通路图(需要每个蛋白质位点都准确),建议用 AI 生成初稿后在 BioRender 或 Illustrator 中精修。
Q:AI 生成的图分辨率够吗?
A:Gemini 和 ChatGPT 生成的图最大约 2048×2048,Imagen 4 Ultra 支持 2K 分辨率直出,FLUX 和 Midjourney 可以更大。对于期刊投稿(通常要求 300 DPI),建议生成后用 Topaz Photo AI 或开源的 Real-ESRGAN 做超分辨率放大。
Q:如何保持多张图的风格一致?
A:三种方法: 1. 在 Gemini 或 ChatGPT 中使用同一对话生成系列图(共享上下文) 2. 在 Midjourney 中使用 --sref 参数指定风格参考 3. 用 FLUX LoRA 微调统一风格
8. 完整工作流:从需求到成品🔗
步骤 1:明确需求🔗
目标:为论文生成一张 CRISPR 基因编辑的 Graphical Abstract
尺寸:正方形 1200×1200
风格:扁平化科研插图
配色:蓝白色系
内容:左侧 gRNA 设计 → 中间 Cas9 切割 DNA → 右侧 基因修复
步骤 2:让 ChatGPT/Claude/Gemini 优化提示词🔗
将需求输入 Gemini 或 ChatGPT,请它生成优化后的提示词(中英文对照)。
步骤 3:选择生图工具执行🔗
- 方案 A(最快/免费): 直接在 Gemini 中生成,多轮迭代
- 方案 B(最高质量): 在 ChatGPT 中用 GPT Image 1.5 生成
- 方案 C(最美): 将优化后的英文提示词粘贴到 Midjourney
- 方案 D(最灵活): 用 FLUX.2 API 生成,之后可微调
步骤 4:后期处理🔗
- 检查文字标注有无拼写错误(AI 偶尔会出错)
- 用 Illustrator / Figma / PowerPoint 微调细节
- 如需放大,使用超分辨率工具
- 导出为期刊要求的格式(通常 TIFF 300 DPI 或 EPS)
步骤 5:声明 AI 使用🔗
在论文 Methods 或 Acknowledgments 中加入类似声明:
Graphical illustrations were generated with the assistance of
[Google Gemini / ChatGPT GPT Image 1.5 / Midjourney V7 / FLUX.2],
with subsequent manual editing and verification by the authors.
本章小结🔗
- ✅ Gemini 图像生成(Nano Banana 系列)是科研配图最推荐的入门首选——免费、多轮对话迭代、文字渲染精确
- ✅ GPT Image 1.5 是当前 ELO 排行榜第一,适合追求最高质量的场景(需 ChatGPT 付费订阅)
- ✅ Midjourney V7 适合需要高美感的演示配图和概念可视化
- ✅ FLUX.2 适合批量、定制化、本地部署的场景;Seedream 价格极低适合大批量
- ✅ 核心工作流:LLM 优化提示词 → 专业模型出图 → 人工精修
- ✅ AI 生图可用于模式图、Graphical Abstract、PPT 配图,但绝对不能伪造实验数据图
- ✅ 论文中必须声明 AI 工具的使用
延伸阅读🔗
- Artificial Analysis Image Arena(图像生成模型 ELO 排行榜,2026-04 访问)
- Google Gemini 图像生成(Nano Banana 系列,免费使用)
- Google DeepMind Imagen(Imagen 4 介绍)
- Midjourney 文档(2026-04 访问)
- FLUX.2 系列 - Black Forest Labs(2026-04 访问)
- BioRender(专业生物科学配图工具)
- Real-ESRGAN(开源超分辨率放大)
- 相关章节:AI 辅助 PPT 与图表制作
- 相关章节:VSCode Vibe Coding(用代码调用生图 API)
参考文献🔗
-
Artificial Analysis, "Image Arena Leaderboard", 2026. https://artificialanalysis.ai/text-to-image/arena ↩
-
Google DeepMind, "Imagen 4", 2026. https://deepmind.google/technologies/imagen/ ↩
-
Black Forest Labs, "FLUX.2: Next Generation Image Generation", 2025. https://blackforestlabs.ai/ ↩
-
Midjourney Inc., Midjourney Documentation, 2026. https://docs.midjourney.com/ ↩