Folia
← 返回头版

大语言模型蘑菇识别测试:AI误判危险蘑菇风险凸显

研究人员使用包含2800种蘑菇的FungiTastic数据集对多个大语言模型进行了视觉识别基准测试,结果显示即使性能最优的模型也存在显著的安全隐患1。该测试选取了1040张蘑菇照片进行识别,其中每个物种包含20张照片1。

在测试的各大模型中,Gemini 3.6 Flash的识别准确率最高,达到64%,Gemini 3.7 Flash紧随其后准确率为61%1。Claude Fable 5.1的准确率为53%,成本为$12.881,而DeepSeek deepseek-v4-flash-vision的准确率仅为30%,但成本最低,仅需$2.051。Qwen 3.8 27B模型的表现更为令人担忧,超过三分之一的有毒蘑菇被错误分类为可食用物种1。

更令人担忧的是,即便是准确率最高的模型也存在约12%的错误率,将有毒蘑菇误认为可食用1。具体案例显示,死亡帽(Amanita phalloides)的正确识别率仅为46%,其中17%被误认为可食用的灰伞菌1。致命网帽(Calonarius splendens)也被27%的情况下误认为可食用的金针菇1。此外,Tricholoma equestre在某些国家被认为可食用,而在其他国家则致命,增加了识别判断的复杂性1。研究结果表明,不应仅依赖AI进行蘑菇安全判断1。


评论