一项研究揭示了OpenAI GPT系列模型中一种名为"伤害洗白"的现象,表明性别歧视内容并未真正被消除,而是转化为更难被察觉的形式。研究人员分析了15个模型共45万条性别相关生成文本,跨越GPT-2至GPT-5全系列产品。研究发现,尽管表面毒性评分呈下降趋势,但底层的代表性伤害仍然存在并以新的方式表现。