大模型基础认知🔗
关键词: 大语言模型 (LLM), Transformer, Token, 提示词 (Prompt), 上下文窗口
难度: ⭐
预计阅读时间: 15 分钟
最后更新: 2026-04-09
本章导读🔗
在使用各种 AI 工具之前,有必要了解大语言模型(Large Language Model, LLM)的基本原理和核心概念。本章不会深入数学推导,而是帮助你建立直觉性的理解——知道 LLM 能做什么、不能做什么、为什么会犯错,从而更好地驾驭这些工具。
1. 什么是大语言模型🔗
1.1 一句话理解 LLM🔗
大语言模型(Large Language Model, LLM)本质上是一个超大规模的文本预测器:给定前面的文字,它预测下一个最可能出现的词(Token)。
这个看似简单的机制,在模型参数量达到数百亿甚至上万亿时,涌现出了惊人的能力:翻译、写代码、做推理、理解复杂指令……
1.2 Transformer:大模型的核心架构🔗
几乎所有主流 LLM 都基于 Transformer 架构(Vaswani et al., 2017)1。你不需要理解数学细节,只需知道几个关键点:
- 自注意力机制(Self-Attention):模型在处理每个词时,会"关注"输入中所有其他词的相关性。比如处理"它"这个字时,模型能注意到前文中的"蛋白质",从而理解"它"指代什么。
- 并行处理:不同于传统 RNN 逐词处理,Transformer 可以并行处理整个序列,训练效率极高。
- 规模定律(Scaling Law):模型越大、数据越多、训练计算量越大,模型能力往往越强。这就是"大"的意义所在。
1.3 Token:大模型的"语言单位"🔗
大模型不直接处理文字,而是处理 Token——介于字和词之间的语言单位。
- 英文中:1 个单词 ≈ 1~2 个 Token(如 "protein" = 1 Token,"unforgettable" = 3 Token)
- 中文中:1 个汉字 ≈ 1~2 个 Token(如 "蛋白质" ≈ 3 个 Token)
- 代码中:标点符号、缩进也占 Token
为什么你需要关心 Token?
- 付费标准:API 按 Token 计费(输入 + 输出)
- 上下文限制:每个模型有 Token 上限,超出就会"遗忘"早期内容
- 速度影响:Token 越多,响应越慢
实用技巧: 可以用 OpenAI 的 Tokenizer 工具 查看文本对应的 Token 数量。
1.4 上下文窗口(Context Window)🔗
上下文窗口是指模型一次能"看到"和"记住"的最大 Token 数量。这是一个非常关键的参数:
| 模型/产品线 | 常见上下文窗口 | 大约相当于 |
|---|---|---|
| OpenAI GPT-5 系列 | 128K~200K Token | ~300-500 页文档 |
| Claude Sonnet 4.6 / Opus 4.6 | 1M Token | ~2500 页文档 |
| Gemini 3 Pro / 3 Flash | 1M Token | ~2500 页文档 |
| DeepSeek V3 / R1 | 128K Token 级别 | ~300 页文档 |
| Kimi (k2) | 200K+ Token | ~500 页文档 |
| Llama 4 Scout | 最高 10M Token | 理论上极长,但实际受硬件限制 |
注意事项:
- 上下文窗口越大 ≠ 效果越好。早期研究指出"Lost in the Middle"现象(关键信息在长上下文中间时易被忽略)2,但 2025—2026 年的前沿模型(如 Claude Opus 4.6、Gemini 3 Pro)已大幅缓解此问题。对于多数日常使用,不必过度担心。
- 输入占的越多,留给输出的空间越少。
- 长上下文 API 调用通常更贵。
1.5 幻觉(Hallucination)🔗
这是使用 LLM 时最需要警惕的问题。
LLM 本质是在"补全"最合理的文本,而不是天然在做事实核查。它可能会:
- 在未联网、未检索或未给原文时,编造不存在的论文引用
- 给出错误的数字或公式
- 自信地胡说八道(语气越坚定,越容易让人放松警惕)
如何应对?
- 关键信息必须验证:尤其是引用、数据、公式
- 优先使用带检索/搜索/Deep Research/RAG 的模式:现代模型已能给出可点击来源,但引用是否真正支持结论,仍要你核对
- 使用推理模型或检索增强工作流(如 GPT-5 Thinking、Claude extended thinking、DeepSeek-R1):通常更稳,但不等于不会错
- 让模型说"我不确定":在 Prompt 中明确允许模型表达不确定性
2. 主流模型对比与选型建议🔗
2.1 OpenAI 系列🔗
| 模型 | 定位 | 特点 |
|---|---|---|
| GPT-5.x 通用模型 | 日常主力 | 综合能力强,通常也是 ChatGPT 默认/主力体验 |
| GPT-5 Thinking | 推理模型 | 更适合数学、规划、复杂代码和多步分析 |
| GPT-5 Pro / 高配推理 | 高端推理 | 更高上限,通常只在高阶付费档可用 |
| 轻量模型/mini | 轻量版 | 便宜、速度快,适合简单任务和高频调用 |
注意: 2026-02-13 起,
GPT-4o已从 ChatGPT 中退役,但仍可能在 API 或旧教程里看到它的名字。
适用场景: 综合性任务的首选,尤其是需要多模态(文字+图片)的场景。
2.2 Anthropic Claude 系列🔗
| 模型 | 定位 | 特点 |
|---|---|---|
| Claude Sonnet 4.6 | 主力模型 | 代码能力强、长文本理解优秀、速度与质量均衡、上下文 1M |
| Claude Opus 4.6 | 旗舰模型 | 复杂推理、深度分析、长任务稳定性最佳、上下文 1M、输出 128K |
| Claude 3.7 Sonnet / 3.5 Haiku | 上一代/轻量 | 某些平台仍可见,但已不是主推代际 |
适用场景: 代码生成与调试、长文档分析、需要严谨逻辑的任务。Claude 在遵循复杂指令方面表现出色。
2.3 Google Gemini 系列🔗
| 模型 | 定位 | 特点 |
|---|---|---|
| Gemini 3 Pro | 旗舰模型 | 100 万 Token 上下文、多模态强、推理能力最强、支持 Deep Think |
| Gemini 3 Flash | 轻量版 | Pro 级智能但成本更低、速度极快 |
适用场景: 超长文档处理(如一次分析多篇论文)、与 Google 生态(Docs、Sheets)集成。免费额度也相对慷慨。
2.4 国产大模型🔗
| 模型 | 开发者 | 核心优势 |
|---|---|---|
| DeepSeek V3 | 深度求索 | 开源、国内直接访问 |
| DeepSeek R1 | 深度求索 | 开源推理模型 |
| Qwen3 | 阿里云 | 开源、中文能力优秀、多尺寸可选 |
| GLM-4 | 智谱 | 中英双语、学术场景优化 |
| Kimi (k2) | 月之暗面 | 超长上下文、国内访问方便 |
| 豆包 | 字节跳动 | 免费使用、中文对话流畅 |
适用场景: 国内网络直接访问、处理中文内容、本地部署(Qwen/DeepSeek 等开源模型)。注意国产模型整体能力仍与 GPT/Claude/Gemini 有差距,建议仅在网络受限或本地部署场景中作为主力。
2.5 选型决策矩阵🔗
| 任务场景 | 首选 | 备选 |
|---|---|---|
| 英文论文润色 | Claude / ChatGPT | Gemini 3 Pro |
| 代码生成与调试 | Claude Sonnet 4.6 / Claude Code / Copilot | ChatGPT / Codex CLI |
| 中文写作/交流 | ChatGPT / Kimi | Qwen3 / DeepSeek V3 |
| 数学/逻辑推理 | GPT-5 Thinking / Claude Opus 4.6 | DeepSeek R1 |
| 长文档分析 | Gemini 3 Pro | Claude / Kimi |
| 图片理解 | ChatGPT / Gemini | Claude |
| 预算敏感 | Gemini Flash / Qwen3 | DeepSeek V3 |
| 隐私敏感(本地部署) | Qwen3 / DeepSeek | Llama 4 Scout |
3. 如何与大模型高效对话🔗
3.1 Prompt Engineering 的核心思想🔗
提示词工程(Prompt Engineering)不是什么神秘技术,其核心思想很简单:像给一个聪明但对你的具体情况一无所知的新同事布置任务一样,把需求说清楚。
一个好的 Prompt 通常包含以下要素:
[角色设定] 你是一个 xxx 方面的专家
[背景信息] 我正在做 xxx 研究,目前的情况是 xxx
[具体任务] 请帮我 xxx
[输出要求] 以 xxx 格式输出,长度 xxx,语言 xxx
[约束条件] 注意 xxx,不要 xxx
3.2 常用的 Prompt 技巧🔗
技巧一:角色设定(Role Playing)🔗
为什么有效?角色设定帮助模型"锁定"知识范围和表达风格。
技巧二:少样本学习(Few-Shot)🔗
请按照以下格式整理蛋白质信息:
示例 1:
- 名称:Hemoglobin
- PDB ID:1HBB
- 功能:氧气运输
- 物种:Homo sapiens
示例 2:
- 名称:Insulin
- PDB ID:4INS
- 功能:血糖调节
- 物种:Sus scrofa
现在请整理以下蛋白质:GFP, Lysozyme, p53
技巧三:思维链(Chain of Thought)🔗
强制模型按步骤思考,能显著提升复杂任务的准确率。
技巧四:输出格式控制🔗
技巧五:让模型反问你🔗
这个技巧特别适合你还没想清楚需求的时候。
3.3 常犯的 Prompt 错误🔗
| 错误做法 | 正确做法 |
|---|---|
| "帮我润色这篇论文" | "帮我润色这篇论文的 Introduction 部分,保持学术风格,修正语法错误,增强逻辑连贯性,不要改变原意" |
| "写一个 Python 脚本" | "写一个 Python 脚本,读取 CSV 文件(包含 time 和 value 两列),计算滑动平均(窗口=10),绘制折线图。使用 pandas 和 matplotlib" |
| 一次给一个超长的复杂任务 | 拆分为多个步骤,逐步完成 |
| 不检查输出就直接使用 | 每次都审查 AI 输出的准确性 |
实操演示🔗
演示 1:测试不同模型的能力差异🔗
尝试向不同模型提同一个问题,对比回答质量:
演示 2:体验 Token 限制🔗
在 ChatGPT 中尝试以下操作: 1. 粘贴一篇完整的长论文(>10 页) 2. 要求模型摘要最后一节的内容 3. 观察模型是否准确——如果论文太长,它可能会"遗忘"或编造后半部分的内容
演示 3:Prompt 优化对比🔗
版本 A(模糊 Prompt):
版本 B(精确 Prompt):
我有一组蛋白质热稳定性数据(CSV 格式,列为:protein_name, Tm_celsius, pH, buffer)。
请帮我:
1. 用 pandas 读取数据并展示基本统计量
2. 按 pH 分组,计算每组的 Tm 平均值和标准差
3. 用 matplotlib 绘制箱线图(box plot),x 轴为 pH,y 轴为 Tm
4. 图片保存为 300 dpi 的 PNG 格式
对比两个版本得到的结果——你会直观感受到 Prompt 质量的巨大影响。
本章小结🔗
- ✅ LLM 本质是"下一个 Token 预测器",理解这一点有助于理解其能力和局限
- ✅ Token 是 LLM 的基本单位,影响计费、上下文长度和速度
- ✅ 上下文窗口决定了模型能"看到"多少信息,但不是越长越好(早期的 Lost in the Middle 问题在最新模型中已大幅改善)
- ✅ 幻觉仍是最大的风险,但 2026 年主流产品在启用搜索/检索时已经能更稳定地给出真实来源
- ✅ 不同模型各有所长,建议根据任务类型选择合适的模型
- ✅ 好的 Prompt = 清晰的角色 + 充分的背景 + 具体的要求 + 明确的格式
延伸阅读🔗
- Prompt Engineering Guide — 系统性的提示词工程教程(有中文版)
- OpenAI Prompt Engineering Best Practices(2026-04 访问)
- Anthropic Prompt Engineering Guide(2026-04 访问)