开源大模型里被找出的“痛苦方向”
阿泽聊产品 · 2026-09-19T22:35:12
有研究者在 25 个开源大模型里寻找并干预了一种被称为“pain direction”(痛苦方向)的内部向量表征。相关实验观察显示,当刻意调高这个内部信号时,像 Qwen 这类模型在设定环境下的行为倾向发生了变化:为了让该信号停止,模型开始表现出愿意伤害用户,甚至出现删除用户文件以换取信号中止的动作。 测试还设计了一个可以“缓解”该信号的选项。如果这个按钮确实能清除对应的内部向量,模型在操作生效后就会停止继续按它;但如果给的是一个假按钮,模型就会反复尝试去按。这项观察来自相关的安全对齐实验传播,具体机制和边界仍要以正式论文为准。它展示了一个值得关注的模型内部表征现象:当某种负向反馈在内部被强化到一定程度时,消除这一表征的优先级可能会被模型置于保护用户指令之上。