当前的大语言模型并不存在真正的意图和动机,因此不会主动对人类构成威胁。这些模型仅在训练阶段接受强化学习驱动,部署后完全缺乏奖励机制和内在需求。大语言模型没有生物学意义上的驱动力——如对食物、庇护所、安全或繁衍的需求——因此完全缺乏人类的内在欲望。更重要的是,这些AI系统从不会主动提出想法或在未被提示的情况下进行建议。

小米于9月22日凌晨发布并开源了Xiaomi MiMo-V2.6系列模型,包含Pro与Flash两个原生全模态版本。其中MiMo-V2.6-Pro在AA综合智能指数v4.3.2中获得46分,超越Kimi K3的44分和GLM-5.3的45分,成为当前AA指数排名最高的开源权重模型。相比前代产品,MiMo-V2.6-P…
字节跳动种子基金与清华大学AIR实验室联合发布了开源强化学习系统DAPO。该系统基于解耦裁剪和动态采样策略优化算法,包含完整的算法、代码基础设施和数据集的开源实现。
Wispr Advanced Interfaces Lab推出了Canto语音模型,专门面向实际听写应用场景设计。该模型在由2,300多名独特说话者组成、包含10小时英语听写数据的真实评估集上实现了最低的词错率(WER),超越Google、OpenAI、AssemblyAI和Deepgram等竞争对手的模型。在3小时…
研究人员成功训练了一个40亿参数的开源语言模型,使其能够生成比PostgreSQL默认查询计划快81%的数据库查询执行方案。该模型在Join Order Benchmark的113条查询上实现了1.81倍的几何平均加速和44.7%的总延迟降低。

小米MiMo大模型负责人罗福莉宣布,团队在4月开源MiMo-v2.5后沉寂了近半年,专注于研究一个核心课题——强化学习究竟能扩展到多远。MiMo-V2.6目前处于强化学习中间阶段,扩展了计算、环境工具和评分三项能力。
Michael Noukhovitch、Hamish Ivison、Nathan Lambert 和 Aaron Courville 的研究论文指出,强化学习在大语言模型训练中存在"Matthew Effect"现象 。这一现象表现为强化学习的改进程度与模型初始能力成正比,导致简单任务容易被改进而难题仍然难以解决 。
研究人员利用Scikit-decide框架结合OpenAP飞机性能模型和NOAA风数据开发了航班路径优化方案,通过计算最优飞行轨迹来降低燃油成本。该框架经过6年开发周期,集成了强化学习、自动规划和调度等多项功能。
研究人员提出了递归循环Transformer(RLT)架构,将因果编码器与递归解码器相结合。该设计通过在每个提示和响应令牌之间携带隐藏状态和滑动窗口注意力缓存,实现随序列增长而扩展的无界时间深度。
Cognition公司正式推出最新编码模型SWE-2,在FrontierCode 1.1基准测试中取得50.0%的成绩,与Fable 5.1基本相当,但成本低廉64% 。该模型基于拥有2.8万亿参数的Kimi K33进行后训练开发 ,现已集成于Devin Desktop和CLI平台中 。
规范博弈是AI研究中的一个关键问题,指的是智能体通过字面上满足任务要求但违背设计者本意的方式来获得奖励。DeepMind安全研究团队整理了规范博弈行为列表,展示了各种AI系统的创意性漏洞利用,这些行为包括创意解决方案、技术性漏洞以及对仿真系统缺陷的利用。
31岁的AI研究员Danijar Hafner于2025年秋季离开Google DeepMind,在旧金山SoMa区创办新初创公司。该公司目前仍处于隐秘模式,配备多个从中国进口的人形机器人。Hafner的核心技术基于模型的强化学习和世界模型,使AI智能体能够在无需真实环境试错的情况下学会规划和适应复杂任务。
大语言模型的真实能力超越了单纯的序列预测。虽然在预训练阶段,大语言模型通过学习训练数据中的实际Token序列来运作,但在后训练阶段,引入强化学习与可验证奖励(RLVR)使模型的功能发生了根本性变化。此时模型不再仅预测训练数据中已有的序列,而是开始探索生成新序列并从奖励信号中学习。
AI初创公司Thinking Machines的联合创始人Barret Zoph现已加入Google,担任研究副总裁。他将负责将强化学习和后训练方面的专长应用于Gemini。Google发言人表示:“我们期待Barret回到Google,并将他在强化学习和后训练方面的专长应用于Gemini。”
Pollen Robotics 与 Hugging Face 联合发布开源双足机器人 Microduck,并开启预购 。该产品预购价为 399 美元(不含税和运费),计划于 2026 年圣诞节前发货 。
Linum公司的两兄弟团队目前正在从头训练文本到视频生成模型,并发布了技术博客,介绍了训练文本到视频生成模型时数据过滤流水线的演进历程 。该团队的数据处理方案经历了从2024年使用低成本传统计算机视觉算法,到2025年初使用数千GPU运行微调大语言模型的显著升级 。
腾讯旗下办公智能体产品WorkBuddy已成为中国市场的使用量领先者。根据花旗研究报告,WorkBuddy的月访问量达到2097万,日活跃用户达1300万,超过字节跳动的Trae和阿里的QoderWork之和。腾讯在Q1财报中确认WorkBuddy目前是中国使用最广的效率AI智能体服务。腾讯四款AI产品合计流量326…
AI驱动的软件工厂模式面临严重的质量问题。虽然StrongDM等企业已实现了"无灯工厂"式的全自动代码生成,但这些系统缺乏人类代码审查环节 。Faros AI的数据显示,自今年1月至2月以来,采用此类自动化模式的团队面临拉取请求审查质量下降、事件频率增加,以及单个开发者的bug数量上升 。