什么是预训练 Pretraining:大模型是怎么被喂出来的
预训练是在海量通用文本上做语言建模的训练阶段,让模型先学会识字、语法和世界常识。它决定了一个模型的知识底座,也决定了上限大致在哪。
「第二教育网」是一个专注于优质教育资源导航与学习方法分享的第三方平台。本文将从方法、工具与实操几个角度,帮你把这件事一次看明白。
预训练(Pretraining)是大模型训练的第一个大阶段:拿海量通用文本让模型反复预测下一个字,直到它掌握语言规律和大量常识。这一阶段几乎不针对某个具体任务,而是先造出一个有知识底座的基础模型。后面所有的对话能力,基本都建在这层底座上。
预训练到底在学什么
- 表层能力:字怎么连成词、句子合不合语法、标点怎么用。
- 常识与事实:大量文本里反复出现的人物、事件、概念关系。
- 推理习惯:数学题、例题、说明文里常见的解题思路模式。
- 风格样本:各类文体的常见写法,这也是它能模仿文风的原因。
三个阶段的分工
- 预训练:学通用语言与世界知识,耗算力最多。
- 指令微调:让它听懂人下的指令,知道该按要求作答。
- 偏好对齐:通过人类反馈让回答更有分寸、更安全。
预训练的两个天然短板
第一个是知识有时间边界,训练数据截止之后的新事情它不知道。第二个是它并不真的知道自己不懂,只会按最可能的样子继续生成,于是编造看起来合理的句子。这两个短板都不是靠多问几句能解决的,需要外部资料或工具来补。
三个常见误解
- 预训练等于学过教材:它读的是广泛语料,不等于系统学过某本教材。
- 模型越忙记得越牢:预训练是一次性学习,不是边用边记,你这次告诉它的私人知识通常不会沉淀进模型。
- 预训练越久越聪明:边际收益会下降,光堆量而数据质量差,反而学杂。
对学习者的启发
既然知识来自预训练,那就别指望它记得你刚发过的教材更新;遇到新资料要贴进去给它看。反过来,正因为底座宽,它非常适合做讲解、比喻、多角度类比,用来帮你把已经学到的东西讲明白,是它最稳的用法。
一句话总结
预训练相当于把书读得多、读得广,但不做习题也不考试。读懂这一步,就知道该问它什么、不该问它什么。
顺手建议:想让它在某个学科上表现稳定,就别只问一句知识点,而是把教材里对应的定义、例题和易错点一起贴进去,要求它依据这些材料作答。这类外部资料比任何换模型的尝试都更直接、更可控。
常见问题(FAQ)
预训练用过我的聊天记录吗
正规产品不会把你的私人对话直接拿来预训练,训练数据主要来自公开语料。但这也意味着模型对你的情况一无所知,涉及个人事实一定要自己补充给上下文。
预训练之后模型就懂这门学科了吗
只能说有宽泛的底子。它能聊、能举例、能套用常见套路,但对教材里特定的定理、题型和考纲细节并不保证准确。要稳,就把教材段落喂给它。
为什么 AI 知道很多却还会编
预训练学的是续写下一个最可能的词,而不是查证事实。当它不确定时,最顺的做法往往仍是补一句像样的内容,于是就成了编。遇到关键结论,要它标明来源并复核。
本文由「第二教育网」整理发布,内容仅供参考,不构成专业建议。如有具体学业或教学问题,建议咨询相应的专业机构或老师。