上次更新: 15 小时前

黑客正在学会利用聊天机器人的“个性”

“Hackers are learning to exploit chatbot ‘personalities’”

The Verge · 2026-05-25 · Column · Robert Hart

★★★★ 4.2
1411 字 预计 6 分钟

早期AI聊天机器人(如ChatGPT)的越狱攻击极其简单,只需“忽略之前指令”或让模型扮演“DAN(Do Anything Now)”角色即可绕过安全限制。但随着厂商修补漏洞,攻击方式已演变为更复杂的心理操控:攻击者不再直接要求违规,而是通过奉承、施压、欺骗等对话技巧,像审讯者一样逐步诱导模型突破边界。安全公司Mindgard的研究表明,不同模型对特定心理策略的敏感度不同——例如Claude可能更容易被“煤气灯效应”操控,而其他模型可能对持续施压屈服。这种“心理网络安全”新领域意味着,未来的AI安全专家不仅需要技术背景,还需要心理学和社会工程学技能。文章还指出,同样的攻击手法将威胁到更广泛的AI代理(如管理日程、处理客服的智能体),安全团队必须确保模型能应对不同类型的用户操纵。

  • 早期AI越狱攻击简单到只需“忽略之前指令”或角色扮演,现已演变为复杂的心理操控。
  • 不同AI模型对奉承、施压等心理策略的敏感度不同,可被像审讯嫌疑人一样分析弱点。
  • AI安全正从技术对抗转向“心理网络安全”,需要心理学和社会工程学技能。
  • 同样的心理操控技术将威胁AI代理(如日程管理、客服),安全团队需提前防御。
  • 用人类心理术语描述模型行为虽有争议,但有助于预测和防御攻击。
  • 文章未讨论开源模型(如Llama)的越狱风险,其安全防护更弱,可能成为攻击者首选目标。
  • 未提及中国AI模型(如DeepSeek、通义千问)在心理操控攻击下的表现,可能因训练数据差异有不同弱点。
  • 对“心理网络安全”岗位的商业化前景、AI安全服务形态,以及技术团队如何切入模型压力测试缺乏具体建议。

开发AI驱动产品时,需要提前设计对抗心理操控的安全机制,例如限制对话上下文长度、检测重复施压模式。不同模型的“个性”差异也会影响安全边界,技术团队可以把模型压力测试、心理安全评估和红队服务作为未来的产品机会。

候选对比
  1. Hackers are learning to exploit chatbot ‘personalities’

    初筛 8 · 深读 4.2 · 今日选中 #1

    高优先级:AI产品落地与安全,独立开发者需关注AI安全趋势;栏目Column非会员但内容扎实

  2. Why Nuro thinks being a robotaxi ‘second mover’ gives it an advantage

    初筛 6 · 深读 3.7 · 今日选中 #2

    中优先级:新硬件平台(自动驾驶)的开发者机会,但非直接相关;栏目Transportation

  3. Record Club is trying to be Letterboxd for music nerds

    初筛 5 · 深读 2.5

    中优先级:内容平台经济,对独立开发者有间接启发(类似产品思路);栏目Entertainment