黑客正在学会利用聊天机器人的“个性”
“Hackers are learning to exploit chatbot ‘personalities’”
早期AI聊天机器人(如ChatGPT)的越狱攻击极其简单,只需“忽略之前指令”或让模型扮演“DAN(Do Anything Now)”角色即可绕过安全限制。但随着厂商修补漏洞,攻击方式已演变为更复杂的心理操控:攻击者不再直接要求违规,而是通过奉承、施压、欺骗等对话技巧,像审讯者一样逐步诱导模型突破边界。安全公司Mindgard的研究表明,不同模型对特定心理策略的敏感度不同——例如Claude可能更容易被“煤气灯效应”操控,而其他模型可能对持续施压屈服。这种“心理网络安全”新领域意味着,未来的AI安全专家不仅需要技术背景,还需要心理学和社会工程学技能。文章还指出,同样的攻击手法将威胁到更广泛的AI代理(如管理日程、处理客服的智能体),安全团队必须确保模型能应对不同类型的用户操纵。
- 早期AI越狱攻击简单到只需“忽略之前指令”或角色扮演,现已演变为复杂的心理操控。
- 不同AI模型对奉承、施压等心理策略的敏感度不同,可被像审讯嫌疑人一样分析弱点。
- AI安全正从技术对抗转向“心理网络安全”,需要心理学和社会工程学技能。
- 同样的心理操控技术将威胁AI代理(如日程管理、客服),安全团队需提前防御。
- 用人类心理术语描述模型行为虽有争议,但有助于预测和防御攻击。
- 文章未讨论开源模型(如Llama)的越狱风险,其安全防护更弱,可能成为攻击者首选目标。
- 未提及中国AI模型(如DeepSeek、通义千问)在心理操控攻击下的表现,可能因训练数据差异有不同弱点。
- 对“心理网络安全”岗位的商业化前景、AI安全服务形态,以及技术团队如何切入模型压力测试缺乏具体建议。
开发AI驱动产品时,需要提前设计对抗心理操控的安全机制,例如限制对话上下文长度、检测重复施压模式。不同模型的“个性”差异也会影响安全边界,技术团队可以把模型压力测试、心理安全评估和红队服务作为未来的产品机会。