第1章:大语言模型到底是什么?从零开始的AI认知升级

第1章:大语言模型到底是什么?从零开始的AI认知升级

系列导读:这是「AI知识成长体系」系列的开篇。如果你刚接触大模型,本章帮你建立底层认知;如果你已有经验,建议从第3章「幻觉与可控性」开始,那里的工程视角同样值得回顾。


一、一句话定义

大语言模型(LLM, Large Language Model)是用海量文本语料预训练、参数规模达到百亿乃至万亿级别、基于自回归方式逐字生成文本的统一模型。

它不是「一台能聊天的电脑」,也不是「一个搜索引擎」。最本质的理解是:它是一个概率续写器——给定前n个词,预测第n+1个词的概率分布,然后挑一个词,继续往下预测。

二、一个核心类比

想象你在玩「成语接龙」:我说「指鹿为马」,你说「马到成功」;我说「功」,你说「功成名就」……

LLM 每天都在玩这个游戏,只是规模不一样:它接的不是几个字,是互联网上的几千亿个token。玩了几个月后,它发现自己不仅能填词,还能写诗、编程、做数学题。这就是 LLM 的根本工作方式——下一个 token 预测

三、LLM vs 传统 NLP 的本质区别

维度 传统 NLP 大语言模型
任务模式 一任务一模型 一模型万任务
实现方式 流水线拆分:分词→词性标注→NER→下游任务 端到端:输入文本,输出文本
模型性质 判别式(输出标签/概率) 生成式(输出新文本)
能力边界 训练目标里有的才会 规模够大时涌现出新能力
迁移学习 需要微调适配 Prompt 即任务

为什么说这是「质变」?

传统 NLP 里,你要做情感分析,就训练一个情感分类器;做命名实体识别,就训一个 NER 模型。每个模型只会在训练数据里的「标签空间」内输出结果。

LLM 不一样。它只学了一件事:预测下一个词。但这个任务太极端了——互联网上的每一个句子都是一个训练样本。学会这个任务的过程中,它被迫理解了语法、语义、推理、常识、编程逻辑……所有能用语言表达的思维模式。

涌现能力(Emergent Abilities)

这是 LLM 最令人惊讶的特征。当模型规模突破某个阈值(通常是数十亿到百亿参数),会突然「涌现」出训练目标里没有显式教过的能力:

  • 上下文学习(In-Context Learning):给几个示例,模型就能学会新任务模式
  • 多步推理(Chain-of-Thought Reasoning):面对复杂问题能一步步拆解思考
  • 跨语言迁移:主要训练英语,却也能流畅地说中文、日语

这些能力在结构上没有变化,只是参数量变多了。就像水加热到100度突然沸腾——量变到了阈值,质变自然发生。

四、LLM 的核心特性

1. 知识冻结(Knowledge Cutoff)

LLM 的知识截止到训练数据的收集日期。GPT-4 训练数据到2024年初,之后的事它不知道。你问它2026年7月的股市走势,它会一本正经地编答案——这就是幻觉

2. 没有真正的「理解」

LLM 并不「理解」你说的每一句话。它只是在统计意义上学会了「哪些词组合在一起概率最高」。这带来了两个后果:

  • 它能做对数学题,但可能不理解数学意义——因为训练数据里见过足够多的推导过程
  • 它不会主动说「我不知道」——因为训练目标要求它必须产出下一个词

3. 上下文长度有限

LLM 的「工作台」(context window)不是无限的。GPT-4o 是 128K token(约10万字),Claude 3.5 是 200K(约15万字),超过的部分会被遗忘。这意味着:

  • 长文档对话到后面会开始「掉线」
  • RAG(检索增强生成)成为必修课
  • 任务拆解和记忆压缩是工程核心

五、为什么说这是一个时代的开始?

LLM 的伟大之处,不在于它有多聪明,而在于它是第一个能用自然语言跟全世界沟通的通用接口

在它之前,你想让计算机做一件事,需要学编程语言、API 文档、数据库查询。现在你只需要说:「帮我写一个爬虫,抓取某网站的新闻标题。」

它不完美,经常出错,但它开启了一个人机协作的新时代。它不是「替代人类」,而是「让人类用更自然的方式调用信息」。

六、本章小结

  • LLM 本质是「下一个 token 预测」,参数规模带来的涌现效果是质变
  • 与传统 NLP 的根本区别在于「一模型万任务」和「涌现能力」
  • LLM 有三大天生缺陷:知识冻结、没有真正的「理解」、上下文有限
  • 认识这些缺陷,才不会陷入「AI万能论」或「AI无用论」的两个极端

思考题

  1. 如果 LLM 只是在做「概率续写」,为什么它能做对数学题?是「真正学会了」还是「模式匹配」?
  2. 涌现能力的出现,对人工智能研究意味着什么?它是否暗示了规模是通往通用智能的路径之一?