研究者探索了将gzip压缩算法用于语言建模的可行性。该方案基于压缩与预测等价性的原理,即每个预测模型本质上是一个压缩器,所有压缩算法都可作为预测模型。
在与AI系统的互动中,人类存在系统性的认知偏差。评论作者指出,人类倾向于为AI对话赋予意图性,将其视为具有思想的对话者,但实际上AI只是数学运算和统计推断,不具有真正的意图或理解能力。
扩散语言模型正在成为推理阶段的关键技术进展。掩码扩散语言模型(MDLM)本质上是具有随机掩码率的生成式BERT,通过平行生成能够实现显著的推理加速。截至2026年,已有多个产业级扩散模型发布,在质量上与自回归模型相当。

儿童掌握语言的效率远远超越现代人工智能模型,这一发现正引发科学家的深入思考。研究表明,儿童在满一岁时仅通过听到约1000万单词就已开始掌握语言,而Meta的Llama 3.1等现代大型语言模型在预训练时需要15万亿个token才能获得类似能力。斯坦福大学认知科学家Michael C. Frank指出这一巨大差异的荒谬…