头版Folia Daily Briefing
← 返回头版
科技人工智能

初创公司竞逐大语言模型新架构 探索超越Transformer的道路

自2017年Transformer架构问世以来,大语言模型的发展日益面临计算效率和能耗的挑战[1]。OpenAI今年计划在计算上花费50亿美元[1],而国际能源署预测数据中心总用电量将在2030年翻倍[1],这些因素促使多家初创公司开始探索超越Transformer的下一代技术方案[1]。

多个创新方向正在同时推进。Subquadratic开发的稀疏注意力机制模型SubQ声称是首个在搜索和编码等任务上与主流大语言模型相当的同类产品[1];Liquid AI的液态神经网络模型LFM由20%的Transformer和80%的液态神经网络组成[1],已获得近3400万次下载[1],可在价值50美元的树莓派上运行[1];Inception的扩散模型Mercury 2声称性能与OpenAI的GPT-4相当,但速度快10倍[1];Pathway基于状态空间模型开发的Dragon Hatchling在超过250000个数独谜题的基准测试中击败了97%的谜题[1]。这些初创公司通过各自独特的技术路径,试图在计算效率、上下文窗口和推理能力等方面突破Transformer架构的局限[1]。


大语言模型TransformerAI初创公司神经网络模型优化