跳转至

AI 生图与科研配图🔗

关键词: AI 生图, 科研模式图, Nano Banana, Gemini 图像生成, GPT Image, FLUX, Midjourney, Seedream, 提示词优化, Graphical Abstract
难度: ⭐⭐
预计阅读时间: 35 分钟
最后更新: 2026-04-09


本章导读🔗

2025-2026 年,AI 图像生成迎来井喷式爆发。Google 的 Nano Banana 系列(Gemini 原生图像生成)、OpenAI 的 GPT Image 1.5、Black Forest Labs 的 FLUX.2 系列以及字节跳动的 Seedream 等模型轮番刷新榜单。在 2026 年 4 月的 Image Arena 排行榜上,这些模型在文字渲染、指令遵循、画面质量方面已经达到了惊人的水平。

⚠️ 注意: 早期广为流传的"GPT-4o 图像生成"已于 2026-02 随 GPT-4o 退役而下线。当前 ChatGPT 使用的是 GPT Image 1.5 模型;而 Google Gemini 的原生图像生成(内部代号 Nano Banana 系列)在免费用户中也广泛可用,是当前性价比最高的选择。

对科研人员来说,AI 生图最重要的应用场景是:

  1. 科研模式图(Schematic / Mechanism Diagram):论文中的机制示意图、信号通路图
  2. Graphical Abstract:期刊投稿要求的图形化摘要
  3. 演示配图:组会 PPT、学术海报的插图
  4. 概念可视化:将抽象科学概念转化为直观图像

本章将系统介绍当前最强的 AI 生图工具、科研场景下的最佳实践,以及提示词优化工作流——如何用大模型帮你写出完美的提示词,再交给专业生图模型生成高质量图片。


1. AI 生图工具全景🔗

1.1 Image Arena 排行榜(2026 年 4 月)🔗

以下是 Artificial Analysis Image Arena(基于用户盲测投票的 ELO 排名)的前 12 名:

排名 模型 背后产品 ELO 提供商 大致费用
1 GPT Image 1.5 (high) ChatGPT 图像生成 1265 OpenAI ~$133/千张
2 Nano Banana 2 Gemini 3.1 Flash 图像 1257 Google ~$67/千张
3 Nano Banana Pro Gemini 3 Pro 图像 1215 Google ~$134/千张
4 FLUX.2 [max] FLUX 旗舰 1201 Black Forest Labs ~$70/千张
5 Seedream 4.0 字节跳动生图 1185 BytePlus ~$30/千张
6 FLUX.2 [pro] FLUX 专业版 1182 Black Forest Labs ~$30/千张
7 FLUX.2 [flex] FLUX 灵活版 1181 Black Forest Labs ~$60/千张
8 Seedream 4.5 字节跳动生图升级 1172 BytePlus ~$40/千张
9 Grok Imagine xAI 生图 1171 xAI ~$20/千张
10 Imagen 4 Ultra Google 专用图像模型 1169 Google DeepMind ~$60/千张
11 Nano Banana Gemini 2.5 Flash 图像 1164 Google ~$39/千张
12 FLUX.2 [dev] Turbo FLUX 开源快速版 1164 fal.ai ~$8/千张

名词解释: - Nano Banana 是 Google Gemini 模型图像生成功能在 Image Arena 中的代号。Nano Banana Pro = Gemini 3 Pro 图像生成,Nano Banana 2 = Gemini 3.1 Flash 图像生成。 - GPT Image 1.5 是 OpenAI 2026 年推出的最新图像生成模型,取代了已退役的 GPT-4o 图像生成。 - Seedream 是字节跳动(ByteDance)旗下的图像生成模型。

1.2 主流工具速查🔗

工具 核心优势 适合场景 访问方式 费用
Gemini 图像生成(Nano Banana 系列) 免费使用、多轮对话迭代、文字渲染强 科研配图首选:模式图、Graphical Abstract gemini.google.com / AI Studio 免费(Gemini)/ API 计费
GPT Image 1.5 ELO 榜首、指令遵循极强、多轮迭代 复杂场景、精确控制 ChatGPT 网页/APP ChatGPT Plus/Pro
Midjourney V7 画面美感顶级、风格化极强 演示配图、概念可视化、海报插图 网页版 midjourney.com 按月订阅
FLUX.2 系列 开源可商用、速度快、LoRA 微调灵活 批量生图、定制风格、本地部署 API / 本地部署 API 按量计费 / 本地免费
Seedream 4.x API 价格极低、效果好 批量生图、预算敏感场景 BytePlus API ~$30/千张
Imagen 4 Google 专用图像模型、2K 分辨率 超高分辨率需求 Google AI Studio / Vertex AI API 计费
Stable Diffusion 3.5 完全开源、社区生态强大 本地部署、深度定制 本地运行 免费

1.3 科研场景推荐选择🔗

科研场景 首选工具 原因
论文模式图 Gemini(Nano Banana Pro) 免费、文字标注精确、可多轮迭代
Graphical Abstract Gemini / GPT Image 1.5 Gemini 免费好用;GPT Image 质量最顶
PPT 插图 Midjourney / Gemini Midjourney 美感强、Gemini 快速免费
概念示意图 Gemini / GPT Image 1.5 理解科学概念,文字+图像配合好
批量同风格图 FLUX.2(LoRA 微调)/ Seedream 一次训练批量生成 / API 批量调用
超高分辨率 Imagen 4 Ultra 支持 2K 分辨率直出
涉密/数据敏感 Stable Diffusion / FLUX.2 Dev(本地) 数据不出本地

重要提醒: 多数学术期刊(如 Nature、Science)允许使用 AI 生成的图像,但要求在论文中声明使用了 AI 工具及具体用途。请查阅目标期刊的投稿指南。


2. Gemini 原生图像生成(Nano Banana 系列)⭐⭐⭐🔗

2.1 为什么推荐 Gemini 作为科研配图首选?🔗

Google Gemini 3 系列模型内置了原生图像生成能力。在 Image Arena 排行榜上,Gemini 家族有三个模型进入前 12(Nano Banana Pro #3、Nano Banana 2 #2、Nano Banana #11),且免费用户即可使用,是科研配图性价比最高的选择:

  1. 免费使用:通过 gemini.google.com 对话即可生成图像,无需付费订阅
  2. 多轮对话迭代:生成一张图后可以说"把标注字体放大""配色换成蓝绿色系",模型在对话中保持图像一致性
  3. 精确文字渲染:Nano Banana Pro 在文字渲染准确率方面表现优秀,科研配图中的标注不易出错
  4. 原生多模态:同一个模型同时理解文字和生成图像,能利用对话中的科学知识理解你的需求
  5. 上传参考图:上传一张草图或现有图片,AI 在此基础上生成

模型选择: - Gemini 3 Pro(对应 Nano Banana Pro):质量最高,适合精细科研配图 - Gemini 3.1 Flash(对应 Nano Banana 2):速度极快,ELO 排名 #2,日常生图首选 - 在 Gemini 网页端一般默认使用最新模型,无需手动选择

2.2 科研配图实操🔗

示例 1:生成信号通路模式图

提示词(在 Gemini 中直接输入):
请生成一张 MAPK/ERK 信号通路的科研模式图,白色背景,风格简洁专业。
要求:
- 从细胞膜受体(RTK)开始,经过 Ras → Raf → MEK → ERK 的级联
- 每个蛋白用不同颜色的圆角矩形表示,标注英文名称
- 用箭头表示激活关系,用 T 形符号表示抑制
- 最终展示 ERK 进入细胞核调控转录因子
- 标注 2-3 个关键抑制剂(如 Sorafenib 作用于 Raf)
- 整体风格类似 Cell Signaling Technology 的通路图
- 图像尺寸 16:9

示例 2:生成 Graphical Abstract

提示词:
请为以下论文生成一张 Graphical Abstract:
论文主题:利用深度学习预测蛋白质-配体结合亲和力
关键发现:新模型比传统对接方法准确率提升 35%

要求:
- 左侧展示蛋白质 3D 结构 + 小分子配体
- 中间是一个深度学习神经网络的示意图
- 右侧是预测结果(结合亲和力评分)
- 整体使用蓝白配色,专业简洁
- 尺寸按照目标期刊要求(正方形 1200x1200)
- 不要太多文字,关键位置用英文标注

2.3 多轮迭代技巧🔗

Gemini 图像生成的杀手级功能是多轮对话迭代

  1. 先生成初版 → 看整体构图是否满意
  2. "把背景改成浅灰色" → 微调颜色
  3. "蛋白质的标注字体放大一点" → 调整细节
  4. "在右下角加上比例尺" → 补充元素
  5. "整体风格再扁平化一些,参考这张图的风格"(上传参考图)→ 风格调整

技巧: 每次只改一个方面,不要一次提太多修改要求,否则模型可能偏离之前的内容。


3. GPT Image 1.5(ChatGPT 图像生成)🔗

3.1 核心能力🔗

GPT Image 1.5 是 OpenAI 于 2026 年推出的最新图像生成模型,ELO 排名第 1(1265 分),取代了 2025 年 3 月发布的 GPT-4o 图像生成。在 ChatGPT 中使用图像生成功能时,背后调用的就是这个模型。

核心优势:

  1. ELO 排行榜第一:在指令遵循、画面质量、文字渲染等综合评测中拿下榜首
  2. 精确文字渲染:能在图像中准确生成文字标注,这在科研配图中极为关键
  3. 多轮对话迭代:与 Gemini 类似,支持在对话中逐步修改
  4. 上下文理解:能利用对话中的科学知识理解你的需求
  5. 指令遵循:能同时处理包含 10-20 个不同物体的复杂场景

3.2 GPT Image 1.5 vs Gemini 图像生成🔗

对比维度 GPT Image 1.5 Gemini(Nano Banana Pro)
ELO 排名 #1(1265) #3(1215)
费用 ChatGPT Plus $20/月 免费
文字渲染 极强
多轮迭代
中文提示词
访问便利 需付费 免费直接用

建议: 日常科研配图用 Gemini(免费且效果好);需要最高质量或 Gemini 搞不定时用 GPT Image 1.5


4. 提示词优化工作流 ⭐⭐⭐🔗

4.1 核心策略:LLM 写提示词 → 专业模型出图🔗

这是当前最高效的 AI 生图工作流:

  1. 用 ChatGPT / Claude / Gemini 等大模型优化提示词——它们擅长理解你的模糊需求并转化为精确的、生图模型友好的提示词
  2. 用专业生图模型(Midjourney / FLUX)执行生图——它们的图像风格化能力极强

当然,如果你直接用 Gemini 或 ChatGPT 生图(它们自己就能出图),这个"两步法"就不是必须的。但对于 Midjourney 和 FLUX 这类只接受提示词输入的模型,用 LLM 帮你写提示词效果远好于自己写。

4.2 让 ChatGPT/Gemini 帮你写 Midjourney 提示词🔗

你是一个专业的 Midjourney 提示词工程师。我需要生成一张科研论文用的模式图。

我的需求:
[描述你想要的图片]

请帮我生成一个优化后的 Midjourney 提示词,要求:
1. 使用英文
2. 包含风格描述(如 flat design, scientific illustration, minimalist)
3. 包含颜色方案(适合科研论文的配色)
4. 包含质量参数(如 --ar 16:9 --v 7 --s 200)
5. 避免过于复杂的场景,保持简洁专业

4.3 让 Claude 帮你写 FLUX 提示词🔗

你是一个专业的 FLUX 图像生成提示词专家。我需要为科研论文生成一张配图。

我的需求:
[描述你想要的图片]

请帮我生成一个 FLUX 友好的提示词:
1. 英文描述
2. 详细但有条理(先主题,再风格,再细节)
3. 指定风格关键词:scientific illustration, clean design, white background
4. 指定质量关键词:high resolution, vector graphics style, print quality

4.4 Gemini / ChatGPT 直接生图的提示词模板🔗

Gemini 和 ChatGPT 图像生成的提示词更灵活,因为它们理解自然语言。但好的结构仍然重要:

请生成一张 [图片类型] 的图像。

主题:[具体描述]
风格:[扁平化 / 手绘 / 写实 / 科研插图风格 等]
配色:[蓝白 / 暖色 / 指定配色方案]
尺寸:[16:9 / 正方形 / 指定像素]
背景:[白色 / 透明 / 浅灰]
文字标注:[需要哪些文字标注及位置]
参考:[参考某个风格 / 上传参考图]

要求:
- 线条清晰,适合印刷
- 标注字体清晰可读
- 整体专业简洁

4.5 提示词常用修饰词速查🔗

目标 英文关键词 说明
科研插图风格 scientific illustration, schematic diagram, medical illustration 专业严谨
扁平设计 flat design, vector style, minimal, clean 简洁现代
手绘风格 hand-drawn, sketch style, watercolor 软性表达
照片级真实 photorealistic, hyper-realistic, cinematic lighting 逼真质感
白色背景 white background, isolated, clean background 论文用图
高清质量 high resolution, 4K, print quality, crisp details 印刷质量
透视示意 cross-section, cutaway view, exploded view 剖面/拆解
流程图 flowchart, pipeline diagram, workflow 流程展示
分子结构 molecular structure, protein structure, ball-and-stick model 化学/生物

5. Midjourney 科研配图指南🔗

5.1 基础设置🔗

  1. 访问 midjourney.com 注册账号
  2. 进入创作界面
  3. 建议使用 V7 模型(默认最新版)

5.2 科研配图提示词模板🔗

通用科研模式图:

Scientific schematic diagram of [主题], flat design style, 
clean white background, professional color palette using
blue and teal tones, labeled components in English, 
arrows showing relationships, high resolution, 
print quality --ar 16:9 --v 7 --s 100

生物学机制图:

Detailed biological mechanism diagram showing [机制], 
medical illustration style, cell membrane cross-section, 
protein complexes labeled in English, phosphorylation 
cascades with directional arrows, professional scientific 
color scheme, clean layout --ar 16:9 --v 7 --s 150

Graphical Abstract 模板:

Clean graphical abstract for a scientific paper about [主题],
left-to-right workflow layout, minimalist flat design,
key findings highlighted, professional scientific illustration,
blue-white color scheme, no excessive text, 
high resolution --ar 1:1 --v 7 --s 200

5.3 重要参数说明🔗

参数 作用 科研推荐值
--ar 宽高比 16:9(海报/PPT);1:1(Graphical Abstract);3:4(期刊配图)
--v 模型版本 7(最新)
--s 风格化程度 100-200(过高会太艺术化)
--q 质量 1(默认)或 2(更精细)
--no 排除元素 --no text, watermark(排除不需要的元素)

6. FLUX.2 与 Seedream:API/开源生图🔗

6.1 FLUX.2 系列速览🔗

FLUX 是 Black Forest Labs(Stable Diffusion 原作者团队创办)推出的下一代图像生成模型:

模型 定位 特点
FLUX.2 [max] 旗舰(ELO #4) 最高保真度,适合最终出版
FLUX.2 [pro] 专业(ELO #6) 均衡质量与速度,性价比高
FLUX.2 [flex] 灵活(ELO #7) 支持多种控制条件
FLUX.2 [dev] Turbo 开源快速(ELO #12) 开源权重,支持 LoRA 微调,速度极快
FLUX Kontext 编辑 自然语言编辑已有图片

6.2 FLUX Python API 调用示例🔗

import replicate

# 使用 FLUX 2 Pro 生成科研配图
output = replicate.run(
    "black-forest-labs/flux-2-pro",
    input={
        "prompt": "Scientific schematic diagram of CRISPR-Cas9 gene editing mechanism, "
                  "clean white background, flat design, labeled components, "
                  "professional blue-teal color scheme, high resolution",
        "width": 1920,
        "height": 1080,
        "num_inference_steps": 50,
        "guidance_scale": 7.5
    }
)
print(output)

6.3 LoRA 微调:统一风格批量生图🔗

如果你的论文需要多张风格一致的配图,可以用 FLUX LoRA 微调:

  1. 准备 10-20 张目标风格的参考图(如你实验室以往论文的配图风格)
  2. 使用 FLUX Dev + LoRA 训练
  3. 之后所有生图自动保持统一风格

这在准备系列论文实验室标准化配图时特别有用。

6.4 Seedream(字节跳动)🔗

Seedream 是字节跳动推出的图像生成模型,在 Image Arena 排行榜上 Seedream 4.0 排名 #5(ELO 1185),API 价格极低(约 $30/千张),适合大批量生图场景:

  • Seedream 4.0:ELO 1185,综合质量接近 FLUX.2 [max]
  • Seedream 4.5:ELO 1172,更新版本但评分略低
  • 通过 BytePlus API 调用(字节跳动的海外云服务)
  • 对中文场景支持友好

适用场景: 需要大批量生图且预算有限时,Seedream 是极具竞争力的选择。


7. 科研配图的注意事项与伦理🔗

7.1 学术伦理红线🔗

可以做 ✅ 不可以做 ❌
用 AI 生成示意图、模式图 用 AI 伪造/修改实验数据图
用 AI 生成 Graphical Abstract 用 AI 生成虚假的显微镜/Western Blot 图
用 AI 辅助配色和排版 用 AI 生成"看起来像真实实验结果"的图
在论文中声明使用了 AI 不声明 AI 参与

7.2 常见问题🔗

Q:AI 生成的模式图精度够用吗?

A:对于 Graphical Abstract 和 PPT 配图完全够用。但如果是精确的信号通路图(需要每个蛋白质位点都准确),建议用 AI 生成初稿后在 BioRender 或 Illustrator 中精修。

Q:AI 生成的图分辨率够吗?

A:Gemini 和 ChatGPT 生成的图最大约 2048×2048,Imagen 4 Ultra 支持 2K 分辨率直出,FLUX 和 Midjourney 可以更大。对于期刊投稿(通常要求 300 DPI),建议生成后用 Topaz Photo AI 或开源的 Real-ESRGAN 做超分辨率放大。

Q:如何保持多张图的风格一致?

A:三种方法: 1. 在 Gemini 或 ChatGPT 中使用同一对话生成系列图(共享上下文) 2. 在 Midjourney 中使用 --sref 参数指定风格参考 3. 用 FLUX LoRA 微调统一风格


8. 完整工作流:从需求到成品🔗

步骤 1:明确需求🔗

目标:为论文生成一张 CRISPR 基因编辑的 Graphical Abstract
尺寸:正方形 1200×1200
风格:扁平化科研插图
配色:蓝白色系
内容:左侧 gRNA 设计 → 中间 Cas9 切割 DNA → 右侧 基因修复

步骤 2:让 ChatGPT/Claude/Gemini 优化提示词🔗

将需求输入 Gemini 或 ChatGPT,请它生成优化后的提示词(中英文对照)。

步骤 3:选择生图工具执行🔗

  • 方案 A(最快/免费): 直接在 Gemini 中生成,多轮迭代
  • 方案 B(最高质量): 在 ChatGPT 中用 GPT Image 1.5 生成
  • 方案 C(最美): 将优化后的英文提示词粘贴到 Midjourney
  • 方案 D(最灵活): 用 FLUX.2 API 生成,之后可微调

步骤 4:后期处理🔗

  1. 检查文字标注有无拼写错误(AI 偶尔会出错)
  2. 用 Illustrator / Figma / PowerPoint 微调细节
  3. 如需放大,使用超分辨率工具
  4. 导出为期刊要求的格式(通常 TIFF 300 DPI 或 EPS)

步骤 5:声明 AI 使用🔗

在论文 Methods 或 Acknowledgments 中加入类似声明:

Graphical illustrations were generated with the assistance of 
[Google Gemini / ChatGPT GPT Image 1.5 / Midjourney V7 / FLUX.2], 
with subsequent manual editing and verification by the authors.

本章小结🔗

  • Gemini 图像生成(Nano Banana 系列)是科研配图最推荐的入门首选——免费、多轮对话迭代、文字渲染精确
  • GPT Image 1.5 是当前 ELO 排行榜第一,适合追求最高质量的场景(需 ChatGPT 付费订阅)
  • Midjourney V7 适合需要高美感的演示配图和概念可视化
  • FLUX.2 适合批量、定制化、本地部署的场景;Seedream 价格极低适合大批量
  • ✅ 核心工作流:LLM 优化提示词 → 专业模型出图 → 人工精修
  • ✅ AI 生图可用于模式图、Graphical Abstract、PPT 配图,但绝对不能伪造实验数据图
  • ✅ 论文中必须声明 AI 工具的使用

延伸阅读🔗


参考文献🔗


  1. Artificial Analysis, "Image Arena Leaderboard", 2026. https://artificialanalysis.ai/text-to-image/arena 

  2. Google DeepMind, "Imagen 4", 2026. https://deepmind.google/technologies/imagen/ 

  3. Black Forest Labs, "FLUX.2: Next Generation Image Generation", 2025. https://blackforestlabs.ai/ 

  4. Midjourney Inc., Midjourney Documentation, 2026. https://docs.midjourney.com/