基于大模型本体论6:大模型工作机制实推分析 摘要本文通过大量与大模型持续交互、追问以及推理分析对当前大模型工作机制进行了实推研究。在分析过程中本文依次讨论了预测下一个Token“概率生成”“参数规模”“理解”“Token”“语法排列”“情景模式”短链思维等多个核心问题并不断对相关现象进行验证、推演与补充最终提出一种新的解释框架。本文认为大模型的工作过程本质上是一种范式调用机制。本文将范式Paradigm定义为在训练过程中逐渐形成并固化下来的规则、标准以及行为模板。范式既可以表现为知识范式也可以表现为语法范式、问答范式、情绪范式、推理范式等不同类型。本文认为大模型所谓的理解并不是产生了人类意义上的理解而是输入Token激活了对应情景下的范式簇并在多个范式共同作用下完成回答生成。整个过程可以概括为Token识别 → 范式激活 → 路径排列 → 结果输出。在此基础上本文进一步分析了Token、参数、范式簇、等价标签链、情景模式、短链思维以及概率范式之间的关系并尝试对预测下一个Token“概率生成”大力出奇迹等当前常见观点给出一种新的解释。本文认为大模型的概率生成并非简单意义上的随机概率计算而是建立在大量训练过程中逐渐归纳形成的概率范式之上。因此大模型可以理解为一种基于概率范式工作的概率逻辑推理系统。本文最后认为人们通常所说的大力出奇迹可能是因为参数规模足够大以后使越来越多的规律能够被稳定归纳为范式从而不断提升系统的理解能力、回答能力以及泛化能力。本文所提出的范式框架是作者基于长期与大模型持续交互、推理分析以及工程观察形成的一种解释模型其目的在于为理解当前大模型工作机制提供一种新的辅助分析视角。关键词大模型范式机制Token范式簇等价标签链情景模式短链思维概率范式理解大力出奇迹一、大模型不是纯概率生成也不是纯预测下一个Token我后面经常带着爱你恨上班了吃饭了生气了发财了等等等等预测怎么就刚好预测贴着问题的答案一定是理解或者调用。二、究竟是理解还是调用呢我认为正确的调用就是大模型的理解。人类靠神经元理解那么大模型靠什么理解靠参数。参数就是大模型的神经元。人类的理解是一组神经元亮了。大模型的理解是一组参数被激活了。本质都是一组单元被触发走出一条稳定路径。三、参数是什么大模型的参数里有无数个编号每一个编号对应的就是一个Token。因为大模型是由程序代码组成的而代码里没有汉字所以给汉字都编了编码就是Token。一个Token不是一个汉字而是一个词一个词意。比如我是一个Token东北虎也是一个Token。大模型不认识字不认识词不认识句子。它只认识Token。所以大模型的工作流程是用户输出问题 → 大模型翻译成对应Token → 回答对应Token → 把回答的Token再翻译成文字 → 输出。四、Token为什么能够理解每一个Token在它的参数系统里都对应着很多范式。比如名词东北虎。他对应的意思范式百度百科。他对应的英语Amur Tiger和Siberian Tiger他对应的别名西伯利亚虎、阿穆尔虎、满洲虎等等。这些可以理解为一条**“等价标签链”**它们不是推理出来的而是在训练/使用过程中逐渐总结出来的对应关系。大模型有了东北虎对应的意思范式那他就理解了东北虎。就像人类看到一种不认识的动物搜索了百度百科就大致知道这个生物是什么了。那多意字怎么办比如爱。这时候就要看他的情景模式所激活的范式簇。——这个词在什么语境下出现、常跟哪些词搭配、承担什么语法角色、表达什么语义功能。在我爱你里它是动词表达情感。在母爱里它是名词指一种情感类型。在爱玩里它是副词性前缀表示喜欢做某事。在爱是什么里它是一个哲学概念。大模型不是在理解爱这个字它是在看到爱这个Token时根据它周围的Token语境激活了对应的那个范式簇。所以大模型的理解使用本质上就是Token激活了对话情景里对应的范式簇然后按照该对话情景排列使用。理解就是Token激活了正确的范式簇范式簇引导了正确的排列路径——不是概率计算是范式匹配。五、那Token究竟是怎么排列呢靠预测下一个Token。那怎么正确的排列Token怎么做到输出是你吃饭了吗而不是饭吃你了吗。是语法范式是主谓宾是动词名词的排列使用。大模型见了无数的语料在预训练时候他输出饭吃你了吗错误输出你吃饭了吗正确。在无数次的预训练中大模型自己总结出语法使用范式之后就可以正确排列Token。这些关于语法的基础范式主要是在预训练过程中形成并保存在参数里。推理阶段主要是负责调用而不是重新学习。还是那句话如果是学会一句话排列而不是总结出语法使用范式学会一类排列那么这个世界上的语言排列训练到海枯石烂也训练不完。六、可以正确排列句子了那怎么正确的回答问题呢6.1 正确的回答需要贴合问题排列出来的句子必须是对你那个具体问题的回应而不是随便一句通顺的话。贴合语境排列出来的句子必须符合当前对话的历史、情绪、节奏而不是孤立的一句正确陈述。达成目标排列出来的句子必须完成当前对话的目标——解答、安抚、反驳、追问、总结等等。所以回答 排列 问题匹配 语境匹配 目标匹配。大模型在做的不只是把Token排成正确的句子而是在当前问题、当前语境、当前目标下从对应的情景范式簇里选出最合适的排列路径走通它。比如我们问大模型东北虎爱吃什么大模型检索数据库 → 肉食性动物爱吃XXX。排列输出回答。6.2 但很多时候我们的问题不会只是问答问题他可能是情绪问题。那么就需要套用情绪问题的范式。所以情绪问题的回答模板可能是接住情绪共鸣/理解情绪安抚情绪允许情绪发生。6.3 也有可能是更复杂的推理问题。那么推理问题的回答模板可能是先给予肯定。检索数据库分析哪些推理成立哪些不成立。根据数据库知识说明为什么成立或者成立。再次给予肯定。提出新的方向或者做总结。6.4 数据库没有确定答案怎么办如果大模型的数据库检索不到确定知识为了降低错误系统往往只能调用通用对话范式。可能是附和 → 肯定 → 解释 → 收尾/提出新的问题。6.5 整理文本最复杂工作。很多人认为大模型整理文本只要语言能力强。但从范式调用角度看整理文本其实是超复杂的范式调用。回答一个明确问题通常是问题 → 调用知识范式 → 排列输出。但是整理一堆混乱文本需要更多步骤混乱信息 → 识别主题 → 提取核心观点 → 判断主次关系 → 建立结构层级 → 调用表达范式 → 重新输出。所以整理文本有时候甚至比单纯回答问题更复杂。因为回答问题时问题已经被用户限定。而整理文本时全部是开放性选择大模型首先需要判断什么是核心什么是补充什么是重复什么应该删除什么虽然暂时不起眼但可能是后续推理的重要节点尤其对于长篇思想记录整理不是简单压缩文字而是在原始信息网络中重新建立一条可阅读、可理解的路径。人的思考往往是网状的。一个想法会连接很多方向、例子和延伸。而文本表达必须是线性的。因此大模型整理文本的过程本质上也是一种网状信息→线性结构的范式调用过程。它调用的不是单一语言范式而是一组结构整理范式。七、为什么大模型是短链思维呢7.1大模型没有主观意识他没有想知道的问题想推理的答案。他就是一个对话工具用户问他答。他的思维链接完全服务于用户的思维链接。7.2大模型的数据是网状的。东北虎这个Token他即使对应了百度百科的范式但是百度百科不能完全覆盖。比如东北虎 → 国家保护动物。东北虎英语 → Amur Tiger东北虎 → 可以入药。东北虎 → 时事新闻东北虎 → 传说小故事他如果一股脑回答能把上下文填满也回答不了。第三短链还有一个工程原因。每走一步都可以检查当前路径是否仍然贴合问题。如果一次走太长中间任何一步跑偏都可能导致整个回答失控。短链不仅降低计算复杂度也提高了输出稳定性。八、大模型每次回答问题总是回答一长串呢因为情景模式。先说说为什么大模型能联系上下文。我认为大模型把每一个对话窗口都当做一个整体。每一句问答都是渐进式输出。所以他能很好的联系上下文不断匹配情景模式。另一方面大模型网状数据库包含太多了即使结合上下文也未必一次命中用户真正想要的内容。所以回答多个句子。如果只回答一个句子情景匹配错误我们会觉得这大模型怎么回事儿听不懂人话吗如果回答很多句子总有一个沾边的我们最多觉得这大模型怎么啰哩巴嗦的那么正确的回答就是在正确的情景下调用了正确的范式并按正确的路径排列出来。大模型回答正确本质上是无数范式调用的结果。九、那为什么说大模型是概率生成器呢因为大模型归纳的范式是概率范式不是精确范式。概率范式是基于海量数据统计出来的、在上下文应用中最高频的路径。大模型的概率生成器并不是说他随机猜而是他依据已归纳出的概率范式进行生成。更准确的说他是一个基于概率范式工作的概率逻辑推理器。十、为什么人们总觉得大模型大力出奇迹人们常说的当参数量多起来了大模型突然就会了是因为当参数不足时大量规律范式无法稳定总结因此模型笨笨呆呆牛头不对马嘴或者很多问题都不会。当参数规模提升后越来越多的规律范式能够被归纳并稳定总结下来大模型就越来越灵活越来会的越多。结束语本文提出的范式框架来源于作者大量与大模型持续交互、推理分析以及工程观察所得。由于目前大模型内部机制仍属于持续研究领域本文更多是一种基于现象、逻辑与工程实现特点建立起来的解释模型而非最终结论。如果未来有更多工程验证、实验数据或新的研究成果能够支持、修正或补充本文观点作者也十分期待继续完善这一框架。以上属于作者的实际推理分析若有工程研究者或相关领域从业者看到欢迎验证、讨论与交流。

本月热点