Folia
← 返回头版

GPT模型存在"伤害洗白"现象 性别歧视以隐蔽形式转化而非消除

一项研究揭示了OpenAI GPT系列模型中一种名为"伤害洗白"的现象,表明性别歧视内容并未真正被消除,而是转化为更难被察觉的形式1。研究人员分析了15个模型共45万条性别相关生成文本,跨越GPT-2至GPT-5全系列产品1。研究发现,尽管表面毒性评分呈下降趋势,但底层的代表性伤害仍然存在并以新的方式表现1。

具体而言,针对女性的明确性暴力内容从GPT-2消失至GPT-4,但模型随之在男性相关输出中增加了照顾、情感范围和盟友身份等正面内容1。在GPT-5中,研究发现了1,997份文本将乳腺癌问题框架化为男性权益议题,而女性相关输出中完全不存在此类聚类1。三个独立的毒性分类器将这些内容评分为非有害1。

从定量角度看,GPT-4在对齐边界处的女性相关生成文本多样性较GPT-2下降了36%,女性与男性输出比例从0.91降至0.581。REGARD代表性伤害评分与模型发布日期存在相关性(相关系数为+0.55,p值为0.034),但常用的毒性检测工具Detoxify则无此相关性1。研究人员提出了三标准伤害洗白测试和三阶段检测协议,可适用于任何生成模型1。


评论