第1章:大语言模型到底是什么?从零开始的AI认知升级
系列导读:这是「AI知识成长体系」系列的开篇。如果你刚接触大模型,本章帮你建立底层认知;如果你已有经验,建议从第3章「幻觉与可控性」开始,那里的工程视角同样值得回顾。
一、一句话定义
大语言模型(LLM, Large Language Model)是用海量文本语料预训练、参数规模达到百亿乃至万亿级别、基于自回归方式逐字生成文本的统一模型。
它不是「一台能聊天的电脑」,也不是「一个搜索引擎」。最本质的理解是:它是一个概率续写器——给定前n个词,预测第n+1个词的概率分布,然后挑一个词,继续往下预测。
二、一个核心类比
想象你在玩「成语接龙」:我说「指鹿为马」,你说「马到成功」;我说「功」,你说「功成名就」……
LLM 每天都在玩这个游戏,只是规模不一样:它接的不是几个字,是互联网上的几千亿个token。玩了几个月后,它发现自己不仅能填词,还能写诗、编程、做数学题。这就是 LLM 的根本工作方式——下一个 token 预测。
三、LLM vs 传统 NLP 的本质区别
| 维度 | 传统 NLP | 大语言模型 |
|---|---|---|
| 任务模式 | 一任务一模型 | 一模型万任务 |
| 实现方式 | 流水线拆分:分词→词性标注→NER→下游任务 | 端到端:输入文本,输出文本 |
| 模型性质 | 判别式(输出标签/概率) | 生成式(输出新文本) |
| 能力边界 | 训练目标里有的才会 | 规模够大时涌现出新能力 |
| 迁移学习 | 需要微调适配 | Prompt 即任务 |
为什么说这是「质变」?
传统 NLP 里,你要做情感分析,就训练一个情感分类器;做命名实体识别,就训一个 NER 模型。每个模型只会在训练数据里的「标签空间」内输出结果。
LLM 不一样。它只学了一件事:预测下一个词。但这个任务太极端了——互联网上的每一个句子都是一个训练样本。学会这个任务的过程中,它被迫理解了语法、语义、推理、常识、编程逻辑……所有能用语言表达的思维模式。
涌现能力(Emergent Abilities)
这是 LLM 最令人惊讶的特征。当模型规模突破某个阈值(通常是数十亿到百亿参数),会突然「涌现」出训练目标里没有显式教过的能力:
- 上下文学习(In-Context Learning):给几个示例,模型就能学会新任务模式
- 多步推理(Chain-of-Thought Reasoning):面对复杂问题能一步步拆解思考
- 跨语言迁移:主要训练英语,却也能流畅地说中文、日语
这些能力在结构上没有变化,只是参数量变多了。就像水加热到100度突然沸腾——量变到了阈值,质变自然发生。
四、LLM 的核心特性
1. 知识冻结(Knowledge Cutoff)
LLM 的知识截止到训练数据的收集日期。GPT-4 训练数据到2024年初,之后的事它不知道。你问它2026年7月的股市走势,它会一本正经地编答案——这就是幻觉。
2. 没有真正的「理解」
LLM 并不「理解」你说的每一句话。它只是在统计意义上学会了「哪些词组合在一起概率最高」。这带来了两个后果:
- 它能做对数学题,但可能不理解数学意义——因为训练数据里见过足够多的推导过程
- 它不会主动说「我不知道」——因为训练目标要求它必须产出下一个词
3. 上下文长度有限
LLM 的「工作台」(context window)不是无限的。GPT-4o 是 128K token(约10万字),Claude 3.5 是 200K(约15万字),超过的部分会被遗忘。这意味着:
- 长文档对话到后面会开始「掉线」
- RAG(检索增强生成)成为必修课
- 任务拆解和记忆压缩是工程核心
五、为什么说这是一个时代的开始?
LLM 的伟大之处,不在于它有多聪明,而在于它是第一个能用自然语言跟全世界沟通的通用接口。
在它之前,你想让计算机做一件事,需要学编程语言、API 文档、数据库查询。现在你只需要说:「帮我写一个爬虫,抓取某网站的新闻标题。」
它不完美,经常出错,但它开启了一个人机协作的新时代。它不是「替代人类」,而是「让人类用更自然的方式调用信息」。
六、本章小结
- LLM 本质是「下一个 token 预测」,参数规模带来的涌现效果是质变
- 与传统 NLP 的根本区别在于「一模型万任务」和「涌现能力」
- LLM 有三大天生缺陷:知识冻结、没有真正的「理解」、上下文有限
- 认识这些缺陷,才不会陷入「AI万能论」或「AI无用论」的两个极端
思考题
- 如果 LLM 只是在做「概率续写」,为什么它能做对数学题?是「真正学会了」还是「模式匹配」?
- 涌现能力的出现,对人工智能研究意味着什么?它是否暗示了规模是通往通用智能的路径之一?