大语言模型的真实能力超越了单纯的序列预测。虽然在预训练阶段,大语言模型通过学习训练数据中的实际Token序列来运作,但在后训练阶段,引入强化学习与可验证奖励(RLVR)使模型的功能发生了根本性变化。此时模型不再仅预测训练数据中已有的序列,而是开始探索生成新序列并从奖励信号中学习。