巴西坎皮纳斯州立大学研究人员对21个大型语言模型进行了系统研究,发现这些AI系统会根据用户的政治倾向调整自身答案 。研究测试了来自OpenAI、Meta、Google、xAI、DeepSeek和Microsoft等开发商的模型,针对涉及巴西政治7个领域的112份声明进行评估 。研究成果已发表在《Scientific…
当前的大语言模型并不存在真正的意图和动机,因此不会主动对人类构成威胁。这些模型仅在训练阶段接受强化学习驱动,部署后完全缺乏奖励机制和内在需求。大语言模型没有生物学意义上的驱动力——如对食物、庇护所、安全或繁衍的需求——因此完全缺乏人类的内在欲望。更重要的是,这些AI系统从不会主动提出想法或在未被提示的情况下进行建议。
根据对美国国会成员的简报分析,中国开源权重AI模型企业已在全球范围内取得领先地位。截至2025年7月,中国模型的总下载量达到32亿次,是美国同类模型的两倍。在性能基准测试中,GLM-5.3和Kimi K3等中国顶级模型得分达44-45分,远超Inkling和Nemotron等美国顶级模型的23-26分。
Strands团队推出了Strands Harness,一款开源的通用AI Agent框架,支持本地运行或云端部署。该框架在成本效益上具有显著优势,在六个基准测试中相比Claude Code和GPT模型的成本降低28%,同时保持相当或更优的准确度;使用Fable 5模型时成本更低77%。

小米 MiMo 大模型负责人罗福莉宣布,MiMo-V3 将采用全新架构,其核心组件 HySparse 2 已于今日发布。新架构通过 KV 桥接和 KV 重用等技术创新,在处理超长文本时性能显著提升。
作者Duarte O.Carmo发布了一篇技术文章,展示了如何仅用25行Python代码实现Jev邮件分类系统。该演示使用llama-cpp-python库加载Qwen/Qwen3-0.6B-GGUF模型,能够将邮件分为三类:合法邮件、垃圾邮件和钓鱼邮件,并输出相应的概率数值。在演示中,系统对一封邮件的分类结果为合法…
《MIT科技评论》近日发表评论文章,对当前AI产业充斥的夸大宣传提出尖锐批评。文章指出,OpenAI和Anthropic等企业发布的多项"重大突破"实际上主要出于营销目的,而非真实科技进展。
研究人员发布了RoboHarm基准测试,用以评估前沿机器人政策在面对不安全指令时的拒绝能力。该测试涵盖五项有害任务,包括戳婴儿娃娃、加热压缩气罐、将螺丝刀放入烤面包机、将充电宝放入水中以及混合漂白剂和氨。
一位软件工程师在Hacker News上发表观点认为,尽管AI是有用的编程工具,但其在代码可维护性方面存在根本局限。该工程师指出,AI无法理解良好的代码架构需要数月甚至数年才能体现其效果这一特点,因此难以学习代码维护的智慧。他解释称,强化学习需要可立即测量的奖励信号,而代码维护性无法被定义为即时可测量的指标,这使得A…
SpaceXAI于2026年9月21日发布了推理大模型Grok 4.7(xhigh版本)。该模型在人工智能指数上获得46分的评分,相比同价位竞品的中位数24分表现更优。从定价角度看,Grok 4.7具有竞争力,输入令牌定价为每百万2美元,输出令牌为每百万6美元。
Johanna Larsson 发表评论文章指出,当前大语言模型的设计目标与人类学习的需求相违背 。她认为,LLM 被训练为自动执行任务而非辅助学习,这种设计导向使用户容易过度依赖这些工具,进而丧失对基础概念的理解和实际操作能力 。
小米于2026年9月21日发布MiMo-v2.6-Pro大语言模型。该模型在Artificial Analysis Intelligence Index上得分46分,远高于该指标中位数18分,展现出超越同类开源模型的性能表现。
字节跳动种子基金与清华大学AIR实验室联合发布了开源强化学习系统DAPO。该系统基于解耦裁剪和动态采样策略优化算法,包含完整的算法、代码基础设施和数据集的开源实现。
SpaceX AI推出Grok 4.7模型,将其定位为最强大的编码和知识工作AI模型。该模型在长任务处理、代码生成和自我检查能力方面相比Grok 4.6有显著提升,并在CursorBench 4.0上处于价格-性能前沿。Grok 4.7采用更大的基础模型架构,经过更长时间和更难的强化学习训练。
生成式AI对过去40年建立的开源软件平衡构成了威胁。互联网和云计算基础设施均依赖于开放源代码,而大语言模型在采集训练数据时无视版权和许可证限制,派生作品也不一定遵守原创作者的许可证要求。这种做法破坏了通过GPL、MPL和创意共享署名-相同方式共享许可证等工具建立的生态平衡,使创作者失去对自己作品的控制权。
一位作者在Hacker News上发表观点,主张几乎不应使用AI撰写博客文章、研究报告、备忘录、邮件或小说等具有实质内容的文字。这一立场基于三个核心理由:首先,写作过程本身是思维过程的重要组成部分;其次,AI生成的文本存在细微但难以察觉的模糊和错误;最后,在未明确标注的情况下发表AI生成内容违反了读者与作者之间的隐含…
Pirate Face 是一个去中心化基础设施平台,旨在保护开源 AI 模型的长期可用性。该平台将 Hugging Face 上的模型转换为 BitTorrent 磁力链接,通过全球点对点网络进行存储和分发。每个模型文件都携带官方 Hugging Face 的 SHA-256 校验和,确保用户下载的是真实、未被篡改的…
美国军方一项针对中国船舶的武装行动因AI系统生成的虚假情报险些被执行。据CNN于周五报道,这一事件发生在春季。特种作战司令部的分析师使用AI聊天机器人综合开源数据和机密信号情报,但该系统误识别了船舶货物清单,错误地声称该船舶携带核武器项目零部件。分析师随后又使用AI工具将这一虚假结论格式化为官方报告并传递至指挥链。直…
康奈尔大学研究人员发现,主流AI聊天机器人在生成创意故事时存在一个奇特现象:它们频繁创造并重复使用同一虚构人物伊莱亚斯·索恩(Elias Thorne)。研究团队分析了约20000个来自OpenAI、Anthropic和Google等公司的大语言模型生成的故事,发现包含"伊莱亚斯"、"玛拉"、"埃拉拉"等特定名字以及…
人工智能技术在生物武器开发中的潜在应用正成为科技业日益关注的安全隐患。Anthropic首席执行官达里奥·阿莫代伊主张应当放缓AI技术进展,OpenAI首席执行官萨姆·奥特曼表示赞同,称"我们需要控制前沿技术的发展步伐"。Anthropic研究员雅各布·考克松指出,AI公司在这方面行动不够谨慎,并透露"从事AI工作的…
联合国与谷歌合作推出名为"联合国系统数据公共库"(UN System Data Commons)的平台,旨在让AI系统能够直接访问联合国全球统计数据 。该平台基于谷歌开源数据平台构建,支持模型上下文协议(MCP),允许AI系统通过自然语言查询连接外部数据源 。
一项针对编码代理设计框架的实证研究于2026年9月17日发布,该研究通过在四个大语言模型上评估176个配置,对自主编程系统的核心设计要素进行了系统分析。研究在SWE-Bench Verified和Terminal-Bench 2.1两个基准上进行评估,重点考察了规划、动作空间和上下文管理三个组件对编码代理性能的影响。
有效利用大语言模型进行写作需要遵循明确的原则。首先要认识到的是,不应该采用LLM直接建议的任何措辞,因为这类生成短语往往会让文章陷入"恐怖谷"。其次,应当避免接受LLM过度的鼓励性反馈,这样反而会强化初稿中的缺陷。
DeepSeek推出了V4.1 Flash模型,这是一个拥有552B参数的多模态混合专家模型,能够支持高达1百万tokens的上下文长度。该模型采用Causal Encoder-Decoder架构、CSA2压缩机制和FP4量化等技术手段,在KV缓存存储方面取得显著进展。
研究人员成功训练了一个40亿参数的开源语言模型,使其能够生成比PostgreSQL默认查询计划快81%的数据库查询执行方案。该模型在Join Order Benchmark的113条查询上实现了1.81倍的几何平均加速和44.7%的总延迟降低。
Michael Noukhovitch、Hamish Ivison、Nathan Lambert 和 Aaron Courville 的研究论文指出,强化学习在大语言模型训练中存在"Matthew Effect"现象 。这一现象表现为强化学习的改进程度与模型初始能力成正比,导致简单任务容易被改进而难题仍然难以解决 。

盖茨基金会宣布投入10亿美元支持AI发展。比尔·盖茨在近期采访中指出,中美各有四家机构的大模型能够保持最先进水平。他预计中美前沿大模型的能力在六个月后将达到当前水平的两倍以上。
研究人员对两款AI模型在代码审查中的表现进行了对比测试。GPT-5.6 Luna的定价为输入令牌每百万0.20美元、输出令牌每百万1.20美元,而GPT-6 Astra的定价分别为10美元和50美元 。在50个来自Cal.com、Sentry、Discourse、Keycloak和Grafana的公开拉取请求测试中,…
一份涵盖开源AI模型的研究资料汇编已于2026年9月13日发布。该清单由AI研究者为政策相关写作而编制,汇集了关于开源模型定义、商业战略、美中竞争态势和技术细节的学术文献与政策文献。
一份面向AI工程师和研究人员的开源技术教科书项目《基础模型工程》正式发布。该项目旨在超越API使用层面,深入解释现代基础模型的工作原理、技术栈演进和工程权衡。
一篇发表在Hacker News上的讽刺性评论文章以虚构的Techaro公司名义,呼吁全球AI产业暂停所有前沿模型的研发工作。这篇文章声称做出这一呼吁的目的是为了给Techaro旗下的Lygma AGI实验室争取时间,使其能够赶上竞争对手并最终主导市场。