Transformer模型

科技人工智能

AstroForge利用AI自主系统指挥下一代航天器

小行星采矿初创公司AstroForge正在开发名为Solo的人工智能自主控制系统,用于驾驭其未来的太空探索任务。该系统采用Transformer模型架构,经过约2500个航天器传感器数据的训练。

科技人工智能

OpenArch:现代大语言模型架构的PyTorch实现库

OpenArch是一个开源PyTorch项目,旨在通过清晰易读的代码帮助学习者理解大语言模型的构建原理。该项目计划实现72个LLM架构,目前已包含GPT2、Llama3、Qwen3、Grok2.5、DeepSeek V3、Pali-Gemma等多个主流模型的实现。

科技人工智能

大语言模型不应被简单理解为"下一个Token预测器"

大语言模型的真实能力超越了单纯的序列预测。虽然在预训练阶段,大语言模型通过学习训练数据中的实际Token序列来运作,但在后训练阶段,引入强化学习与可验证奖励(RLVR)使模型的功能发生了根本性变化。此时模型不再仅预测训练数据中已有的序列,而是开始探索生成新序列并从奖励信号中学习。

科技人工智能

研究者用67美分成本在ARC-AGI-1基准测试中实现44%得分

一位AI研究者在NVIDIA 5090 GPU上用1.5小时、成本仅67美分的情况下,采用Transformer模型在ARC-AGI-1基准测试中取得44%的成绩。这一结果与递归模型(TRM/HRM)的表现相当,但所需计算成本大幅降低。该研究者已将代码开源,并鼓励其他贡献者在现有基础上进一步改进,目标是达到65%的准…

科技人工智能

TokenTown:用虚拟城市可视化大语言模型工作原理

TokenTown是一款交互式可视化工具,以虚拟城市的形式直观展示大语言模型的运作机制。该工具在浏览器中实时模拟了Transformer模型的完整处理流程,包括分词、嵌入、位置编码、多头注意力、前馈网络等核心环节,通过等距城市地景的比喻使复杂的计算过程变得易于理解。