跳转至

大模型基础认知🔗

关键词: 大语言模型 (LLM), Transformer, Token, 提示词 (Prompt), 上下文窗口
难度:
预计阅读时间: 15 分钟
最后更新: 2026-04-09


本章导读🔗

在使用各种 AI 工具之前,有必要了解大语言模型(Large Language Model, LLM)的基本原理和核心概念。本章不会深入数学推导,而是帮助你建立直觉性的理解——知道 LLM 能做什么、不能做什么、为什么会犯错,从而更好地驾驭这些工具。


1. 什么是大语言模型🔗

1.1 一句话理解 LLM🔗

大语言模型(Large Language Model, LLM)本质上是一个超大规模的文本预测器:给定前面的文字,它预测下一个最可能出现的词(Token)。

输入: "蛋白质的三维结构决定了其"
模型预测: "功能" (概率 0.72) / "活性" (概率 0.15) / "稳定性" (概率 0.08) / ...

这个看似简单的机制,在模型参数量达到数百亿甚至上万亿时,涌现出了惊人的能力:翻译、写代码、做推理、理解复杂指令……

1.2 Transformer:大模型的核心架构🔗

几乎所有主流 LLM 都基于 Transformer 架构(Vaswani et al., 2017)1。你不需要理解数学细节,只需知道几个关键点:

  • 自注意力机制(Self-Attention):模型在处理每个词时,会"关注"输入中所有其他词的相关性。比如处理"它"这个字时,模型能注意到前文中的"蛋白质",从而理解"它"指代什么。
  • 并行处理:不同于传统 RNN 逐词处理,Transformer 可以并行处理整个序列,训练效率极高。
  • 规模定律(Scaling Law):模型越大、数据越多、训练计算量越大,模型能力往往越强。这就是"大"的意义所在。

1.3 Token:大模型的"语言单位"🔗

大模型不直接处理文字,而是处理 Token——介于字和词之间的语言单位。

  • 英文中:1 个单词 ≈ 1~2 个 Token(如 "protein" = 1 Token,"unforgettable" = 3 Token)
  • 中文中:1 个汉字 ≈ 1~2 个 Token(如 "蛋白质" ≈ 3 个 Token)
  • 代码中:标点符号、缩进也占 Token

为什么你需要关心 Token?

  • 付费标准:API 按 Token 计费(输入 + 输出)
  • 上下文限制:每个模型有 Token 上限,超出就会"遗忘"早期内容
  • 速度影响:Token 越多,响应越慢

实用技巧: 可以用 OpenAI 的 Tokenizer 工具 查看文本对应的 Token 数量。

1.4 上下文窗口(Context Window)🔗

上下文窗口是指模型一次能"看到"和"记住"的最大 Token 数量。这是一个非常关键的参数:

模型/产品线 常见上下文窗口 大约相当于
OpenAI GPT-5 系列 128K~200K Token ~300-500 页文档
Claude Sonnet 4.6 / Opus 4.6 1M Token ~2500 页文档
Gemini 3 Pro / 3 Flash 1M Token ~2500 页文档
DeepSeek V3 / R1 128K Token 级别 ~300 页文档
Kimi (k2) 200K+ Token ~500 页文档
Llama 4 Scout 最高 10M Token 理论上极长,但实际受硬件限制

注意事项:

  • 上下文窗口越大 ≠ 效果越好。早期研究指出"Lost in the Middle"现象(关键信息在长上下文中间时易被忽略)2,但 2025—2026 年的前沿模型(如 Claude Opus 4.6、Gemini 3 Pro)已大幅缓解此问题。对于多数日常使用,不必过度担心。
  • 输入占的越多,留给输出的空间越少。
  • 长上下文 API 调用通常更贵。

1.5 幻觉(Hallucination)🔗

这是使用 LLM 时最需要警惕的问题。

LLM 本质是在"补全"最合理的文本,而不是天然在做事实核查。它可能会:

  • 在未联网、未检索或未给原文时,编造不存在的论文引用
  • 给出错误的数字或公式
  • 自信地胡说八道(语气越坚定,越容易让人放松警惕)

如何应对?

  1. 关键信息必须验证:尤其是引用、数据、公式
  2. 优先使用带检索/搜索/Deep Research/RAG 的模式:现代模型已能给出可点击来源,但引用是否真正支持结论,仍要你核对
  3. 使用推理模型或检索增强工作流(如 GPT-5 Thinking、Claude extended thinking、DeepSeek-R1):通常更稳,但不等于不会错
  4. 让模型说"我不确定":在 Prompt 中明确允许模型表达不确定性

2. 主流模型对比与选型建议🔗

2.1 OpenAI 系列🔗

模型 定位 特点
GPT-5.x 通用模型 日常主力 综合能力强,通常也是 ChatGPT 默认/主力体验
GPT-5 Thinking 推理模型 更适合数学、规划、复杂代码和多步分析
GPT-5 Pro / 高配推理 高端推理 更高上限,通常只在高阶付费档可用
轻量模型/mini 轻量版 便宜、速度快,适合简单任务和高频调用

注意: 2026-02-13 起,GPT-4o 已从 ChatGPT 中退役,但仍可能在 API 或旧教程里看到它的名字。

适用场景: 综合性任务的首选,尤其是需要多模态(文字+图片)的场景。

2.2 Anthropic Claude 系列🔗

模型 定位 特点
Claude Sonnet 4.6 主力模型 代码能力强、长文本理解优秀、速度与质量均衡、上下文 1M
Claude Opus 4.6 旗舰模型 复杂推理、深度分析、长任务稳定性最佳、上下文 1M、输出 128K
Claude 3.7 Sonnet / 3.5 Haiku 上一代/轻量 某些平台仍可见,但已不是主推代际

适用场景: 代码生成与调试、长文档分析、需要严谨逻辑的任务。Claude 在遵循复杂指令方面表现出色。

2.3 Google Gemini 系列🔗

模型 定位 特点
Gemini 3 Pro 旗舰模型 100 万 Token 上下文、多模态强、推理能力最强、支持 Deep Think
Gemini 3 Flash 轻量版 Pro 级智能但成本更低、速度极快

适用场景: 超长文档处理(如一次分析多篇论文)、与 Google 生态(Docs、Sheets)集成。免费额度也相对慷慨。

2.4 国产大模型🔗

模型 开发者 核心优势
DeepSeek V3 深度求索 开源、国内直接访问
DeepSeek R1 深度求索 开源推理模型
Qwen3 阿里云 开源、中文能力优秀、多尺寸可选
GLM-4 智谱 中英双语、学术场景优化
Kimi (k2) 月之暗面 超长上下文、国内访问方便
豆包 字节跳动 免费使用、中文对话流畅

适用场景: 国内网络直接访问、处理中文内容、本地部署(Qwen/DeepSeek 等开源模型)。注意国产模型整体能力仍与 GPT/Claude/Gemini 有差距,建议仅在网络受限或本地部署场景中作为主力。

2.5 选型决策矩阵🔗

任务场景 首选 备选
英文论文润色 Claude / ChatGPT Gemini 3 Pro
代码生成与调试 Claude Sonnet 4.6 / Claude Code / Copilot ChatGPT / Codex CLI
中文写作/交流 ChatGPT / Kimi Qwen3 / DeepSeek V3
数学/逻辑推理 GPT-5 Thinking / Claude Opus 4.6 DeepSeek R1
长文档分析 Gemini 3 Pro Claude / Kimi
图片理解 ChatGPT / Gemini Claude
预算敏感 Gemini Flash / Qwen3 DeepSeek V3
隐私敏感(本地部署) Qwen3 / DeepSeek Llama 4 Scout

3. 如何与大模型高效对话🔗

3.1 Prompt Engineering 的核心思想🔗

提示词工程(Prompt Engineering)不是什么神秘技术,其核心思想很简单:像给一个聪明但对你的具体情况一无所知的新同事布置任务一样,把需求说清楚。

一个好的 Prompt 通常包含以下要素:

[角色设定]  你是一个 xxx 方面的专家
[背景信息]  我正在做 xxx 研究,目前的情况是 xxx
[具体任务]  请帮我 xxx
[输出要求]  以 xxx 格式输出,长度 xxx,语言 xxx
[约束条件]  注意 xxx,不要 xxx

3.2 常用的 Prompt 技巧🔗

技巧一:角色设定(Role Playing)🔗

你是一位拥有 20 年经验的结构生物学教授,擅长向研究生解释复杂的蛋白质折叠概念。
请用通俗易懂的语言解释 AlphaFold 的 Evoformer 模块是如何工作的。

为什么有效?角色设定帮助模型"锁定"知识范围和表达风格。

技巧二:少样本学习(Few-Shot)🔗

请按照以下格式整理蛋白质信息:

示例 1:
- 名称:Hemoglobin
- PDB ID:1HBB
- 功能:氧气运输
- 物种:Homo sapiens

示例 2:
- 名称:Insulin
- PDB ID:4INS
- 功能:血糖调节
- 物种:Sus scrofa

现在请整理以下蛋白质:GFP, Lysozyme, p53

技巧三:思维链(Chain of Thought)🔗

请一步一步分析以下实验数据的异常值:
1. 首先,计算每组数据的均值和标准差
2. 然后,找出偏离均值超过 2 个标准差的数据点
3. 最后,分析这些异常值可能的原因

强制模型按步骤思考,能显著提升复杂任务的准确率。

技巧四:输出格式控制🔗

请将以下内容翻译为英文,并以 JSON 格式返回:
{
  "original": "原文",
  "translation": "译文",
  "key_terms": ["术语1", "术语2"]
}

技巧五:让模型反问你🔗

我要写一篇关于 CRISPR 基因编辑的综述。在你开始写之前,请先问我 5 个关键问题,
以确保你能写出最符合我需求的内容。

这个技巧特别适合你还没想清楚需求的时候。

3.3 常犯的 Prompt 错误🔗

错误做法 正确做法
"帮我润色这篇论文" "帮我润色这篇论文的 Introduction 部分,保持学术风格,修正语法错误,增强逻辑连贯性,不要改变原意"
"写一个 Python 脚本" "写一个 Python 脚本,读取 CSV 文件(包含 time 和 value 两列),计算滑动平均(窗口=10),绘制折线图。使用 pandas 和 matplotlib"
一次给一个超长的复杂任务 拆分为多个步骤,逐步完成
不检查输出就直接使用 每次都审查 AI 输出的准确性

实操演示🔗

演示 1:测试不同模型的能力差异🔗

尝试向不同模型提同一个问题,对比回答质量:

请解释蛋白质二级结构中 α-螺旋和 β-折叠的区别,
要求:
1. 从氢键模式的角度解释
2. 举出各自的典型蛋白质例子
3. 说明在蛋白质结构预测中的意义
4. 控制在 300 字以内

演示 2:体验 Token 限制🔗

在 ChatGPT 中尝试以下操作: 1. 粘贴一篇完整的长论文(>10 页) 2. 要求模型摘要最后一节的内容 3. 观察模型是否准确——如果论文太长,它可能会"遗忘"或编造后半部分的内容

演示 3:Prompt 优化对比🔗

版本 A(模糊 Prompt):

帮我分析这个数据

版本 B(精确 Prompt):

我有一组蛋白质热稳定性数据(CSV 格式,列为:protein_name, Tm_celsius, pH, buffer)。
请帮我:
1. 用 pandas 读取数据并展示基本统计量
2. 按 pH 分组,计算每组的 Tm 平均值和标准差
3. 用 matplotlib 绘制箱线图(box plot),x 轴为 pH,y 轴为 Tm
4. 图片保存为 300 dpi 的 PNG 格式

对比两个版本得到的结果——你会直观感受到 Prompt 质量的巨大影响。


本章小结🔗

  • ✅ LLM 本质是"下一个 Token 预测器",理解这一点有助于理解其能力和局限
  • ✅ Token 是 LLM 的基本单位,影响计费、上下文长度和速度
  • ✅ 上下文窗口决定了模型能"看到"多少信息,但不是越长越好(早期的 Lost in the Middle 问题在最新模型中已大幅改善)
  • 幻觉仍是最大的风险,但 2026 年主流产品在启用搜索/检索时已经能更稳定地给出真实来源
  • ✅ 不同模型各有所长,建议根据任务类型选择合适的模型
  • ✅ 好的 Prompt = 清晰的角色 + 充分的背景 + 具体的要求 + 明确的格式

延伸阅读🔗


参考文献🔗


  1. Vaswani, A. et al. "Attention is All You Need." NeurIPS, 2017. 

  2. Liu, N. F. et al. "Lost in the Middle: How Language Models Use Long Contexts." TACL, 2024.