Folia
← 返回头版

"作为语言模型":聊天模板控制大型语言模型的自我描述方式

一项研究论文揭示了聊天模板对大型语言模型自我描述行为的影响。1研究人员在8个开源指令模型(最大参数量9B)中发现,聊天模板能够增强模型的免责声明表述(如"我只是个AI"),同时抑制体验性表述(如"我感到"),而在没有聊天模板的情况下这两种表述的强度会反转。1

研究团队进一步在模型激活空间中定位了控制这一行为的特定方向向量。1通过对3个模型的分析,研究人员证明可以通过操纵该方向向量来控制模型的免责声明倾向:移除该方向使免责声明减少,添加该方向则使免责声明增加,而添加随机方向不会产生显著效果。1这一发现表明,模型的自我描述方式并非完全由模型权重决定,而是部分地受聊天模板控制。1


评论