Next Token Prediction
语言模型通过不断挑选紧跟在已有文字之后概率最高的一个片段并拼接上去,从而生成文本的方式
简单来说
可以把 Next Token Prediction 理解为手机键盘“下一个词推荐”功能的高级版。键盘会根据你已经打出的字,给出几个候选的下一个词;语言模型同样会根据目前生成的文字,计算出接下来最可能出现的一个片段,然后选中它。把这个片段加入文本后,模型再看一遍整段文字,继续挑选下一个片段,如此反复,最终就拼出了一段完整的回答。
有趣的是,仅凭这种简单的重复操作,模型却能完成摘要、翻译、写代码这类看起来复杂的任务。要准确预测下一个片段,不仅需要懂语法,还得在一定程度上把握上下文和常识,所以在海量文本上反复进行这种预测训练的模型,自然而然就获得了广泛的能力。但这个方法的局限也恰恰源于此:模型并不是在检索事实来核实,而只是挑选一个看起来说得通的片段接下去,因此有时会用非常自信的语气说出错误的内容。
在报道中是这样出现的
Claude Academy 的“AI Capabilities and Limitations”课程将 Next Token Prediction 与知识、工作记忆、上下文限制等一起,列为理解语言模型能力边界的核心概念。课程指出,常见的误解是把它单纯当作自动补全,但实际上推理、摘要等复杂能力恰恰是从这种反复预测的过程中自然涌现出来的。
亲手试一试
在聊天窗口里试着只给出半句话,比如:
请自然地续写下面这句话:今天早上看着天空,
拿到回答后,再问问模型为什么选择那样接下去——你就能直观感受到它是如何依据前文,按概率一个片段接一个片段地续写下去的。
