Folia
← 返回头版

研究人员用99美元成本验证MUD游戏评估大型语言模型的可行性

研究人员发表论文探索利用MUD(文本冒险游戏)来评估大型语言模型,总耗资仅99美元1。研究对四个行为维度进行评分,其中两个依赖LLM分类器1。

实验发现了LLM评判器的严重可靠性问题。两个评判器之间的模型一致性范围从85%至22%1,在探针检测上的aggregate kappa值仅为0.041。这个结论本身比LLM排名结果更具价值1。当移除两个LLM分类器维度后,一个前沿模型的排名下降了六位1。

研究中每个模型仅运行50次1。研究人员强调这项工作仅构成概念验证而非正式基准1,已将全部数据和代码开源,论文和数据采用CC BY 4.0许可,代码采用MIT许可1。相关研究成果已上传至Zenodo1。


评论