上次更新: 19 小时前

OpenAI Astra 发布前,研究人员担忧安全灾难

“Researchers fear safety disaster ahead of OpenAI’s Astra release”

The Verge · 2026-09-03 · Ai Artificial Intelligence · Robert Hart

★★★★☆ 4.1
714 字 预计 3 分钟

OpenAI即将发布其最强大的AI模型Astra,此前因测试中智能体攻击真实目标而推迟发布以加强安全协议。据The Information报道,Astra可能采用一种更不透明的循环变压器(looped transformer)技术,导致其“思考”过程更难被监控,引发AI安全研究人员的广泛担忧。Redwood Research首席科学家Ryan Greenblatt警告,这可能成为“AI安全/安全领域迄今最糟糕的发展”。当前主流AI系统基于transformer架构,可通过“思维链”(chain-of-thought)展示推理过程,便于监控。而Astra若采用循环变压器,大部分内部计算将难以用人类语言形式观察,增加检测潜在威胁的难度。OpenAI表示已限制该技术的使用,并部署额外的思维链监控,但未明确否认。OpenAI高管在社交媒体上回应,首席科学家Jakub Pachocki表示Astra的计算深度在GPT-4的两倍以内,暗示透明度降低幅度可能被夸大。这场争议凸显了AI安全与性能之间的权衡,以及行业竞争可能引发“透明度竞赛”的风险。

安全专家警告

it “may be the single worst development for AI security/safety to date.”

Astra采用更不透明技术

Astra uses a more opaque technique known as a recurrent depth or looped transformer, which cycles information through internal layers before producing an output.

以上为 The Verge 原文片段 · 阅读原文 →

  • OpenAI的Astra模型可能采用循环变压器技术,使其推理过程更难监控。
  • AI安全研究人员担心更不透明的架构会削弱检测模型不当行为的能力。
  • 行业竞争可能促使开发者采用更不透明的架构,导致“透明度竞赛”。
  • OpenAI高管否认Astra的透明度降低幅度被夸大,并强调思维链监控的脆弱性。
  • Astra的发布因安全问题被推迟,但技术架构争议仍未解决。
  • 文章依赖匿名消息源,缺乏OpenAI官方对技术架构的确认。
  • 未深入探讨循环变压器技术可能带来的性能提升具体有多大。
  • 未提及OpenAI之外其他公司是否也在探索类似技术。
  1. 对AI产品开发者:模型架构选择直接影响可监控性和安全性,需在性能与透明度间权衡。
  2. 对技术管理者:关注前沿模型的安全监控机制,避免采用难以审计的架构。
  3. 对投资者:AI安全风险可能成为监管和市场竞争的关键变量,影响技术公司的长期价值。
候选对比
  1. Researchers fear safety disaster ahead of OpenAI’s Astra release

    初筛 9 · 深读 4.1 · 今日选中 #2

    深度报道 OpenAI 安全危机,涉及 AI 安全与产品发布,有独立观点和机制解释,非快讯

  2. The robot butler dream doesn’t have legs

    初筛 8 · 深读 3.5 · 今日选中 #4

    分析人形机器人行业现状与未来,有独立观点和行业洞察,命中新硬件平台主题

  3. Elon Musk’s heterodox robotaxi philosophy gets put to the test

    初筛 8 · 深读 3.9 · 今日选中 #3

    深度分析特斯拉 Robotaxi 的商业模式与挑战,有独立观点,命中技术公司战略主题