数学家要求 OpenAI 证明未使用其未发表成果
“Mathematicians want proof OpenAI didn’t use their work”
数学家Andreas Thom公开质疑OpenAI的数学发现可能受益于用户与ChatGPT的交互。OpenAI上月高调宣布10项数学进展,其中一项涉及Thom专长的non-sofic groups(非索菲群,一种无法用有限结构逼近的无限数学结构),并承认该结果大量基于Thom和Gábor Kun的先前工作。Thom注意到OpenAI对其技术细节的掌握异常精准,于是致信OpenAI研究员Sébastien Bubeck和Mark Sellke,询问自己与ChatGPT的对话是否被纳入训练数据或推理过程。OpenAI回复只否认直接访问具体用户数据,但未说明这些对话是否进入训练数据池。Thom认为这是“不诚实”,并指出只有OpenAI拥有相关数据,研究者无法逆向工程其训练流程。此前纽约大学教授Tristan Buckmaster也质疑OpenAI的Navier-Stokes解可能受益于其使用Codex。OpenAI在博客中否认使用任何具体用户数据,但承认“不能排除去标识化数据间接帮助改进模型”。Thom批评这种区分是混淆视听:“去标识化可以去掉名字,但去不掉数学思想的知识内容。”多位数学家担心,此类行为会迫使领域走向保密,因为任何突破传闻都可能引发与资源雄厚的科技巨头的竞赛。
Thom 对 OpenAI 技术细节的掌握感到惊讶
Thom said he was also struck by “OpenAI’s detailed command of our techniques,” which he said were neither the most obvious nor the most promising routes to a solution at the time.
去标识化无法去除数学思想内容
“De-identification may remove a name; it does not remove the intellectual content of a mathematical idea,” he said.
以上为 The Verge 原文片段 · 阅读原文 →
- 数学家Andreas Thom质疑OpenAI的数学成果可能受益于用户与ChatGPT的交互数据。
- OpenAI只否认直接访问具体用户数据,不排除去标识化数据间接影响模型。
- Thom认为只有OpenAI拥有训练数据,研究者无法验证自己的成果是否被使用。
- OpenAI在数学圈引发不安,可能迫使数学家因担心竞赛而转向保密。
- 文章未提供OpenAI训练数据政策的具体条款或法律依据,读者难以判断其行为是否合规。
- 未采访OpenAI以外的第三方数据伦理专家,缺乏对“去标识化数据”行业惯例的对比。
- 未讨论数学家与AI公司合作时可能存在的利益冲突或数据共享协议。
- AI公司训练数据来源不透明可能成为产品合规和知识产权的新风险点,产品经理和法务需关注用户数据使用边界。
- 如果用户交互数据被用于改进模型并反哺商业成果,可能引发学术、开源和商业领域的信任危机,影响AI产品的生态合作。
- 创业者和管理者应思考如何在产品设计中明确数据使用政策,避免类似争议损害品牌和用户关系。