一项研究发现,用于验证AI生成临床记录的大语言模型评判器存在严重缺陷,无法有效检测记录中遗漏的信息。研究团队在包含500对单一错误记录的基准测试中发现,这些评判器对遗漏内容的检测率仅为0.50-0.63,而对添加或篡改内容的检测率则达到0.79-0.94。其中基准测试包含298个确定遗漏的事实案例和202个添加或更改…