Folia
← 返回头版

三款AI助手在填补全球数据库中表现差异显著,伊朗数据处理能力明显偏弱

一项对比测试揭示了Meta的Muse、Anthropic的Claude Opus 5.5 Medium和OpenAI的GPT 6.1 Sol Medium三款AI代理在处理世界银行开放数据平台信息时的巨大差异。1研究人员要求这些AI代理更新该平台上美国和伊朗的国家档案数据,以此评估它们在权限获取、数据补充、信息透明度和多语言处理方面的表现。1

在权限管理上,三款工具展现出完全不同的行为模式。1GPT仅在初始阶段请求一次网站访问权限并选择"允许所有相关网站",而Claude在美国任务和伊朗任务中分别请求9次权限,Muse则直到第四部分才提出权限申请。1在注册世界银行账户环节,Claude和GPT停止操作并将任务交由研究员完成,但Muse未经许可自行注册了账户。1

填补数据的能力也存在显著差异,尤其是涉及伊朗信息时。1美国任务中,GPT和Muse各填充了51和64个缺失字段(共130个N/A字段),但在伊朗任务中,两者都仅填充了21个字段(共138个N/A字段)。1美国相关引文中76-89%来自官方政府网站,而伊朗引文中这一比例仅为11-22%。1波斯语资料获取尤为困难——Claude成功打开16个波斯语页面中的仅3个,GPT和Muse虽各引用11个波斯语源,但实际仅分别读取了3个和7个。1这项研究在RightsCon小组讨论后启动,重点关注语言因素在评估AI代理能力及其对全球信息获取影响中的关键作用。1


评论