头版Folia Daily Briefing
← 返回头版
科技人工智能

研究揭示视觉语言模型因背景脉络产生的价格估值偏差

研究者Brianne Lee进行了一项实验,用同一条价格2.43美元的项链在三种不同穿衣背景下拍照,测试包括Claude Fable 5、GPT-5.6、GPT-4o、Grok 4.5、Kimi K3和DeepSeek V4-Pro在内的6个前沿多模态模型的价格估算能力[1]。结果表明这些模型对同一物体的估价差异高达3.6倍,其中Kimi在正式场景估价104美元,而在院子场景仅估价29美元[1]。Claude在正式背景估价62美元对比院子背景的19美元,显示出3.3倍的价格差异[1]。

模型不仅改变了数字估价,还根据衣着背景改变了对项链材料的描述[1]。值得注意的是,当被直接询问穿着不同是否会影响估价结果时,Claude承认这种偏见的存在率达到100%(24/24),而GPT-4o的承认率仅为18%(34/192),两者形成鲜明对比[1]。在纯文本条件下,GPT-4o展现了3.9倍的光晕效应,同时在被要求估值图像时拒绝率高达79%[1]。

该研究基于约1,500次会话和4,604条分析行数据,已将研究数据和代码在CC BY 4.0许可证下开源发布[1]。


多模态大模型AI偏见背景脉络效应行为学研究价值评估偏差