
一个真实的困惑你有没有想过这样一件事同一个AI模型你让它写一首情诗,它能写你让它帮你debug一段Python代码,它也能你让它扮演一个刻薄的产品经理来审你的方案,它照样能演。但如果你去查这个模型的训练目标,你会发现一件很朴素、甚至有点寒酸的事实——它被训练的任务只有一个看到前面一段文字,猜下一个词是什么。这就很奇怪了。猜词游戏,怎么就猜出了写诗、写代码、角色扮演这些看起来完全不同的能力这一章我们就把这件事拆开看。图1-1:模型逐词预测的自回归生成过程猜词到底是怎么猜的先做一个简单的思想实验。假设你看到这样一句话的开头北京烤鸭最正宗的做法是先...你的大脑会自动预测接下来大概率出现的词——片皮“上桌“片皮鸭之类。你不需要有人告诉你烤鸭的做法规则,你只是见过足够多类似的句子,所以能猜出大概率的延续。大模型做的事情,本质上就是这个,只不过它见过的句子是互联网规模的文本——书籍、网页、代码、对话记录、论文,几万亿个词。它在训练过程中反复做一件事:给定前面的内容,预测下一个词最可能是什么,猜错了就调整一点参数,猜对了就强化这个倾向。这个过程重复万亿次。关键的问题来了:为什么这么简单粗暴的一个任务,能训练出这么复杂的能力?猜词猜到极致,就是理解答案是:要把猜下一个词这件事做到极致,模型必须隐式地学会很多更深层的东西。举个例子。如果训练数据里有这样的句子:小明比小红高,小红比小刚高,所以三个人中最高的是...模型要准确猜出下一个词是小明,就不能只靠哪个词出现频率高这种表面统计。它必须在内部某种程度上建立起比较关系和传递性的表示——哪怕它从未被显式教过传递性这个逻辑概念。同样的道理放大到写代码、写诗、角色扮演上:要准确续写代码,模型必须内部编码了变量作用域、语法结构、常见bug模式的规律要写出押韵又贴题的诗句,模型必须编码了音韵规律和意象的搭配习惯要扮演一个刻薄的产品经理,模型必须编码了刻薄这种语气在词汇选择、句式上的统计特征这些能力不是被教出来的,而是为了在海量数据上把猜下一个词这件事做对,模型被迫涌现出来的副产品。这也是为什么这个现象在学术圈被叫做涌现能力(emergent abilities)——训练目标很单一,但规模够大之后,复杂能力自己长出来了。规模效应:为什么越大越聪明这里有个直觉上的问题:既然原理这么简单,为什么早年的小模型做不到这些事,非要等到参数规模、数据规模都上去之后才行?一个不严谨但好用的类比是:一个只读过几百本书的人,可能记得住一些具体的句子和套路,但很难总结出跨领域的抽象规律;而一个读过几百万本书、见过各种表达方式的人,大脑里会自然沉淀出更抽象、更通用的模式——不是记住了某句话,而是理解了某类结构。大模型的规模效应(scaling law)说的就是类似的事:当参数量和训练数据量同时跨过某个量级,模型内部就不再只是记住具体的词语搭配,而是开始编码更抽象的结构性规律——语法、逻辑关系、甚至某种程度的常识推理。这也是为什么GPT-3到GPT-4、以及后续各代模型的能力跃升,很大程度上是堆规模堆出来的,而不是算法发生了根本性的改变。破除一个常见误解:AI是在理解吗说到这里要泼一盆冷水。上面的解释容易让人产生一个误解:哦,那模型内部其实是理解语言、理解世界的。严谨地说,这个说法部分成立,但很容易被过度解读。模型确实编码了大量结构性规律,这些规律在很多任务上表现得跟理解没有可观测的区别。但模型的底层机制,始终是概率预测——它没有一个独立于文本之外的世界模型在验证事实,它输出的是统计上最可能接在这句话后面的词,而不是经过事实核查后确认为真的词。这一点非常关键,因为它直接决定了下一章要讲的内容——为什么AI会一本正经地编造不存在的事实。你现在应该已经能猜到一部分原因了:因为对模型来说,一句话读起来通顺、符合统计规律和内容是真的,本来就是两件不完全相关的事。亲手验证一下打开任意一个AI对话工具(ChatGPT、Claude都可以),输入一句话的开头,不要写完,比如:如果人类明天集体消失,地球上最先发生变化的是观察AI怎么续写这句话,然后换一种完全不同领域的开头再试一次,比如一句诗的开头、一段代码注释的开头。你会发现,AI在每种语境下都能接得上茬,而这正是猜词猜到极致这件事最直观的体现——它不是在查找答案,而是在续写最符合这段上下文统计规律的内容。如果你有API访问权限,还可以进一步观察每一步生成时候选词的概率分布(很多平台的开发者选项里能看到logprobs),你会看到模型在每个位置其实都是在一堆候选词里做加权选择,而不是唯一确定地知道该写什么。今天你能带走的一个判断下次看到AI给出一个让你惊艳或者让你困惑的回答时,先问自己一句:这更像是它经过深思熟虑得出的结论,还是这段上下文,统计上最可能接出来的内容?这个判断习惯,会在后面几章——尤其是讲幻觉、讲评测报告可信度的时候——变得非常有用。学习资源推荐如果你想更深入地学习大模型以下是一些非常有价值的学习资源这些资源将帮助你从不同角度学习大模型提升你的实践能力。一、全套AGI大模型学习路线AI大模型时代的学习之旅从基础到前沿掌握人工智能的核心技能因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取二、640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取三、AI大模型经典PDF籍随着人工智能技术的飞速发展AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型如GPT-3、BERT、XLNet等以其强大的语言理解和生成能力正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取四、AI大模型商业化落地方案作为普通人入局大模型时代需要持续学习和实践不断提高自己的技能和认知水平同时也需要有责任感和伦理意识为人工智能的健康发展贡献力量。