Llm评判器可靠性

科技人工智能

研究人员用99美元成本验证MUD游戏评估大型语言模型的可行性

研究人员发表论文探索利用MUD(文本冒险游戏)来评估大型语言模型,总耗资仅99美元。研究对四个行为维度进行评分,其中两个依赖LLM分类器。