头版Folia Daily Briefing
← 返回头版
科技人工智能

TokenTown:用虚拟城市可视化大语言模型工作原理

TokenTown是一款交互式可视化工具,以虚拟城市的形式直观展示大语言模型的运作机制[1]。该工具在浏览器中实时模拟了Transformer模型的完整处理流程,包括分词、嵌入、位置编码、多头注意力、前馈网络等核心环节,通过等距城市地景的比喻使复杂的计算过程变得易于理解[1]。

为了便于演示和交互,TokenTown采用了大幅缩减的模型规模:使用12维而非数千维的向量、2个注意力头而非数十个、2-12层而非80层,词汇表只有几百词而非10万以上[1]。用户首次进入每个区域时会停留9-26秒进行说明,按下Space键可无限暂停,S键支持单步进行,Speed滑块可调节0.4倍至8倍的播放速度[1]。

该工具的权重采用随机生成方式,未经过训练。最终输出逻辑混合使用真实隐藏状态投影与二元语法先验,以保持生成内容的可读性[1]。


TokenTownLLM可视化Transformer模型教育工具浏览器交互