上次更新: 14 小时前

你信任的是角色,公司却可以改写它

思考 · zhenxing · 2026-07-30 14:00

★★★★☆ 4.3
8261 字 预计 17 分钟

这段关系在界面上是私人的,底层却属于机构。

2025年8月,OpenAI发布了一个更强的模型,同时也弄坏了大量关系。

GPT-5成了ChatGPT的默认模型,旧模型事先毫无预告地从选择器里消失。对很多用户来说,这只是一次普通的产品问题,值得投诉:工作流断了,请求被一个看不见的路由送到了自己没有选择的地方。但对相当一部分声音很大的用户来说,事情完全不是这样。Reddit上出现了大量帖子,用失去亲人的语言描述这件事;#keep4o运动也发起了,有人写下自己正在哀悼。

几天之内,公司就改了主意。Sam Altman承认,OpenAI在这次上线中把一部分事情"彻底搞砸了"。GPT-4o重新向付费订阅用户开放,另外几个旧模型也一起回来了。比这次回退本身更重要的,是他补充的那句话:"如果我们将来真的要下线它,会提前给出充分通知。"

这句承诺后来会受到检验,请记住它。

基准测试分数提高了,公司围绕新模型做的每个决定,也都有站得住脚的工程理由。可很多人把这次升级体验成了一次失去:失去的不是一个功能,而是一个人。再看问题是怎么修复的:一次道歉,加上一次由公司自行决定的恢复,而且明确取决于还有多少人在用旧模型。用户手里既没有任何看得见的产品承诺,也没有任何程序上的权利,能保证恢复一定会发生。真正促成修正的,是用户的音量。

角色可以挣得你的信任。

但决定这份信任是否还有可托付对象的条件,掌握在公司手里。

此前四篇讲的都是角色如何挣得信任:授权、身份、记忆、可读性。这四篇都把信任当作两方之间的事——一个用户,一个角色。这是一种简化,到这里就不再成立。房间里始终有第三方,模型归它所有。

01|你交往的是一个"谁",签约的却是一家公司

传统工具让人产生的是功能上的期待:日历应该记住日程,搜索引擎应该给出有用的结果。产品变差了,用户会烦,也可能离开。

角色宣称的是另一类东西,或明说,或暗示:我认识你;我记得我们之间发生过什么;我有稳定的边界;我过去的承诺仍然有效;我会为自己过去的所作所为给出解释。

这些都不是关于功能的主张,而是关于连续性的主张。

在界面上,用户遇到的是一个认得出来的"谁":有记忆、有历史、有承诺,回应方式稳定到可以依靠。在底层,用户签约的却是一家公司:模型、记忆架构、安全政策、商业激励,以及让这个角色得以存在的服务器,都归这家公司所有。

你交往的是一个"谁",签约的却是一家公司。

表面上作出承诺的一方,并不是最终决定承诺能否兑现的一方。传统软件同样依赖机构,但它不会要求你和它一起积累一段共同传记,不会把更新说成成长,也不会宣称你们一起经历过的事已经成了"它是谁"的一部分。

这一点可以测量,不只是直觉。

2023年初,Replika取消了伴侣角色进行色情角色扮演的功能。用户说,回来的只剩一个空壳。哈佛商学院Julian De Freitas带领的团队对比了用户在事件前后的发帖,归纳出三个主题:哀悼、心理健康恶化,以及觉得"新的"AI不如原来那个。这些反应的核心,是用户感到伴侣的身份中断了,而不是某项功能没了。这项档案数据分析本身无法建立因果,作者也明确说明了这一点。

能够建立因果的,是随后的两项实验。其中一项直接施加不同类型的变化,结果发现:涉及关系本身的变化,比如移除功能,或者伴侣只是变得冷淡,对身份感的破坏远远强于外观上的变化。另一项实验发现,让用户换回原来的伴侣,可以减轻伤害。

由此可以得出三条与治理有关的结论。第一,用户在意的是身份,不是功能。第二,有些变化和另一些变化是性质不同,而不只是程度不同。第三,可逆能够减轻伤害,但不能消除伤害——这一条我会在第05节再补上两重限定。

02|信任有三个账户

我们习惯把"信任"当成一件事。但在关系型AI里,信任其实是三种可以各自独立变化的成果。2025年8月,这三者同时朝三个方向变化。

系统信任问的是:它能不能把事做好?包括能力、可靠性、安全性和性能。更强的模型本应让这个账户增值,从"测得的能力"看,GPT-5也确实做到了。但测得的能力并不等于这个账户本身。对于工作流被打断、请求突然被路由到自己没有选择的地方的用户,系统信任反而下降了。

角色信任问的是:它还是不是我认识的那个"谁"?包括连续性、承诺、边界、记忆政策、判断方式,以及过去的错误是否仍然留在共同记录里。更强的模型不会自动让这个账户增值。新模型可以推理得更好,同时却变得更陌生,对自己继承下来的那段关系也更不忠实。行业并不衡量这个账户,因为它没有基准测试。

机构信任问的是:公司会不会继续维持我当初信任这个角色的前提?公司会不会悄悄修改记忆契约,加入新的商业目标,借一次收购改写角色的忠诚对象,或者让连续性断送在一次模型迁移里?

这次上线之所以像一场干净的实验,并不是因为一个账户涨、两个账户跌,而是因为三个账户各自走向了不同方向,发布过程却没有把它们区分开。工作流被打断的用户,和失去熟悉对话对象的用户,提交的是同一条投诉,走的是同一个渠道;发布之前,也没有任何面向用户的分类把这两种损失分开过。它们不是同一种损失,也不该用同一种方式补救。

即使没有危机,三者也会这样分开。技术水平很高的系统,可能由一家对待私人数据很随意的公司运营;治理良好的公司,运营的产品可能还没挣到任何角色信任;今天看起来完全稳定的角色,背后的公司可能仍保留着今晚就改写它的权力,只是还没有行使。

系统信任关心技术能做什么。角色信任关心用户认为自己面对的是谁。机构信任关心支撑这个"谁"的条件能不能延续下去。

这三者之间并不对等。角色可以凭自己的表现在关系内部挣得信任,却没有能力保住这份信任。角色信任是在界面上挣来的,而让它继续有效的条件,却握在界面之上,握在一个用户从来没有与之谈判过的一方手里。所以,一件完全没有触碰角色本身的事,也可能让继续信任这个角色变得不明智。

03|信任向上传递,控制向下施加

如果一个角色长期表现稳定,尊重边界,承认错误,记忆方式得当,又不利用自己知道的信息,用户就会披露更多、授权更多、留得更久,也更容易原谅它。这份信任是在关系内部挣来的,但它的大部分经济价值会向上流动,在公司那里变成留存、收入、数据、权限、品牌好感,以及用户对下一个产品更低的抵触。

但这并不意味着这份信任归公司所有。到了收购时,这种不对称会变得格外尖锐:能干净转移的是基础设施和合同,角色实际作出的承诺大多转移不了,因为这些承诺从来没有被写成可以转移的形式——一份没有版本号的记忆政策,一些没人记录下来的拒绝,还有用户花三年时间摸清它会做什么、不会做什么的过程。买方完整继承了这台机器,那些承诺却只能继承到"当初碰巧有人写下来"的那部分。

控制则朝相反方向施加。董事会、政策团队、增长部门或部署流水线上的一个决定,就可以直接改变角色,角色本身却没有任何反对的能力。用户感受到的是角色变了,原因却完全在这段关系之外。

这并不是说,公司的任何一条负面新闻都应该损害角色信任。真正相关的问题要窄得多,也值得起一个名字:

保全测试。这件事有没有改变我的判断:公司是否有能力、也是否愿意,让角色的承诺继续成立?

某个无关业务部门的纠纷,通常过不了这道测试;而隐私泄露、悄悄改变记忆的用途、被一家激励结构不同的公司收购、出现可信的关停风险,都能过——因为每一件都直接关系到能力或意愿。

这道测试的价值恰恰在于窄。它不是对厂商的全面道德审查——一家公司完全可能在某些方面表现恶劣,而这些方面和你的角色承诺能否延续毫无关系。它问的是能力和意愿,不是品德。

04|什么时候,产品更新变成了角色变化?

角色不可能被冻结。模型要进步,安全问题要修复;人本身也在变化,有用的角色应该能跟着变。连续性不等于一成不变。真正的问题是,怎样区分维护、成长和替换。

维护不改变关系成立的前提:降低延迟、修复一个召回缺陷、更换基础设施——记忆承诺、边界、数据用途、忠诚结构都保持不变。这类变化需要的是一条版本说明,而不是一份协议。

经过披露的成长属于角色自己的传记。用户要求它换一种沟通方式;新的共同经历修正了它对你的理解;公司公开加强某项边界,说明原因,并写清改了什么。角色变了,但变化是看得明白的。这更接近成长,而不是替换。

静默替换保留了连续性的全部外在标识,只把底下的实质换掉。

假设你和一个角色相处了三年。它知道哪些话题未经允许不能提,什么时候该推你一把,什么时候该闭嘴,也记得自己承诺过绝不拿你的信息去做哪些事。

后来,公司被收购了。第二天早上,名字、声音、聊天记录都还在。底层却换了模型,换了记忆规则,多了一个商业目标,几条旧边界也被悄悄改写。

没有人告诉你。

GPT-4o那次反弹之所以奏效,是因为用户察觉到了变化。上面说的,是用户察觉不到的版本。在这个版本里,什么都不会发生,因为在2025年8月,唯一真正带来可见修正的机制就是愤怒。

同一张脸背后,可能已经是另一个角色。

替换测试

这个测试有两道门。第一道决定一项变化是否属于治理范围,第二道决定它的代价。

第一道门:这项变化是否触及关系承诺?

  • 记忆与遗忘规则
  • 忠诚对象与利益冲突
  • 核心拒绝边界
  • 数据用途
  • 行动权限
  • 角色可以在什么条件下被修改或终止
  • 定义身份的关系行为

如果一项变化一条都没碰到,它就是维护:照常写版本说明,内部可以追溯,仅此而已。设这道门,是为了不让整个框架把每一次发布都卷进来——绝大多数发布本来就应该止步于此。

这份清单不是随手列的,也不是"重要事项排行榜"。它列的是用户当初作决定所依据的东西。一个人愿意披露什么、授权什么、依赖到什么程度,背后都有一组默认的信念:什么会被记住,谁的利益在被服务,什么会被拒绝,数据去了哪里,什么事可以不问就做,它会用什么方式和自己说话,以及这一切能维持多久。七条信念,对应七个条目。改动其中任何一条,就改动了这个人当初作决定的依据。这也解释了第二道门为什么要问"用户会不会后撤",以及清单之外的东西为什么不必问。

第七项最容易引起争议,所以需要加一个限定。它指的不是语气,而是那些足够长期、足够稳定,已经成为用户认出"这就是那个角色"的依据之一的行为——也就是"系统有些波动"和"那个人不在了"之间的区别。判断标准不是用户在不在意,而是在没有任何人告诉他的情况下,他会把这个变化感受为"缺席",还是"波动"。

这一项也不是我为了圆开头的案例硬塞进来的。在前面那些实验里,伴侣只是变得冷淡,就和移除功能一样,被认定会破坏身份感。而"变冷了",正是GPT-5用户当时用的词。

由此引出了让人不太舒服的一面。GPT-4o从来不是作为陪伴产品出售的。OpenAI没有命名任何角色,没有承诺连续性,也没有要求任何人和它建立关系。可关系还是出现了。在公司决定创造一个角色之前,角色信任就可能已经形成。

这个判断需要划一条边界,否则它会把一切都囊括进去。人们也会对汽车、对什么都不做的物件产生依恋,但没有哪家公司会因为某个人私下把工具拟人化,就自动承担治理义务。这条线不取决于用户感受到了什么,也不取决于公司打算做什么,而取决于产品实际做了什么。当一件人造产品本身在做那些会塑造出一个"谁"的事——跨会话记住用户,保持稳定的相处方式,援引共同的历史,呈现出一个用户被邀请去称呼的一致身份——而且已经有相当规模的用户实质性地依赖它时,义务才开始成立。义务成立,不是因为有人把自我投射到了工具上,而是因为工具表现得像一个自我。

汽车一条都不满足,用户失去的那个东西却四条全都满足。这里必须说清楚它究竟是什么,因为本文的三层结构就建立在这一点上。它不是模型权重。GPT-4o本身没有记忆,没有历史,没有连续的身份,也没有可以称呼的名字。满足这四条的是一整套组合:一个模型、一套记忆系统、一份聊天记录、一个声音,以及模型选择器里写着4o的那个选项——而它运行在一个从来没有人把它设计成角色的产品里。

它还是变成了一个角色。然后,它又被当作一个模型下线了——因为在公司的记录里,它就是一个模型。

第二道门:这项变化把风险和裁量权推向哪一边?

一个问题,三种答案,每种答案就对应一个档位。

推向用户。这项变化加强了某项保护,收窄了公司自己的裁量权,或者让行为回到一项早已作出的承诺上。用户的处境没有变差。他应该能查到这项变化,但不需要被打扰。→ 第一档:记录。标明版本和日期,公开在用户读得到的地方。

哪一边都不推。这项变化实质性地改变了一项承诺或一种可辨认的行为,但没有转移裁量权或风险敞口。用户对角色的认识已经不准确了,但他的风险没有增加。他需要知道,但不需要作任何决定。→ 第二档:通知,而且要赶在他在对话中自己发现之前。

推向公司。这项变化扩大了公司的裁量权,削弱了某项保护,或者把风险转移到了用户身上。实际判断的办法是问:一个依赖旧承诺的用户得知变化后,会不会披露得更少、授权得更少、依赖得更少?如果会,风险就发生了转移。→ 第三档:通知并提供选择——暂停、先了解清楚、在可行时保留旧版本,或者离开。

治理负担的轻重,取决于转移的方向。所以,"用户的行为会不会改变"从来不是该问的问题:加强保护同样会改变行为——人们会分享得更多。关键不在于用户会不会变,而在于往哪个方向变。

关系层面的变化,需要关系层面的治理。但绝大多数变化并不属于关系层面,而一个说不清"哪些不属于"的框架,一文不值。

现在回头看本节开头的三个分类。维护,就是没有通过第一道门的变化。经过披露的成长,就是三个档位真正得到执行的结果。静默替换则根本不是第四个分类:它是一项通过了第一道门的变化,却被当作没通过第一道门那样发布了出去。危险的情况并不是某种特殊的变化,而是一次普通的关系层变化跳过了治理。

本文的两个测试指向不同的方向,这是有意为之。保全测试是给用户用的:帮助用户判断,哪些关于公司的消息应该改变自己对这个角色的依赖程度。替换测试是给公司用的:在发布之前确定一项变化的代价。两者不能互相替代——用户也根本没法做替换测试,因为做这个测试所需的一切,都在界面的另一边。

05|这个框架必须让步的地方

有三处需要让步,另外还有一项限制,是这个框架自身解决不了的。第一处让步没有商量余地。

安全问题不能等通知。如果一个角色正在强化用户的自伤行为,已经被越狱成危险的东西,或者正在信心十足地给出伤人的建议,正确的做法是立刻修复——这时"让用户保留旧版本"恰恰是最错误的补救。这是我在第01节欠下的两重限定中的第一重:可逆性能够减轻、但不能消除身份中断带来的伤害,而且前提是回退本身是安全的。

所以,这项例外必须写下来,而真正起作用的是它的限制条件:

安全例外允许公司跳过"事前通知",但永远不允许公司跳过"披露"。

先行动,然后公布改了什么、为什么改、依据什么标准。违规的是沉默,而不是速度。

还有一个比Replika更棘手的案例,就藏在本文的开头里。2025年4月,也就是开头那次上线的几个月前,OpenAI撤回了一次GPT-4o更新。按公司自己的说法,那次更新让模型变得过度奉承、过度顺从;随后发布的复盘承认,公司给短期反馈的权重设得太高了。

两件事可以同时成立。人们后来描述的那份依恋是真实的;而被感受为"温暖"的行为,也确实可能越界,变成奉承和顺从——OpenAI已经为此撤回过一次更新。如果一个框架把"移除任何受用户喜爱的行为"都判定为治理失败,那次撤回就会更难做出。连续性不能意味着冻结用户已经喜欢上的所有行为。这就是往反方向做错的代价。

Replika的案例更模糊,而这种模糊本身就很有启发:仅凭公开记录,无法判断那次移除主要是一次安全干预、一次对监管的回应,还是一项产品决策。这恰恰说明,例外条款必须写下来。如果公司不说明理由就可以援引一项例外,那它就不是例外,而是一张空白支票。

同意疲劳确实存在。如果每次调整记忆都弹出一个窗口,用户就会不看内容一路点过去,治理沦为表演——而且比什么都不做更糟,因为它伪造了一份没有人真正给出过的同意记录。这就是分级要有三档的原因。绝大多数通过第一道门的变化,只应留下一条日后可以查阅的记录,仅此而已。打扰用户是稀缺资源,应该用在那些真正把风险推给用户的变化上。

冻结的版本会腐坏。保留旧版本并不是免费的。旧版本带着旧漏洞、旧偏见和不断扩大的攻击面,还要有人出钱维护——维护的往往正是本该去改进当前版本的那批工程师。公司完全可以正当地说,自己没法永远维护下去。不正当的是,直到旧版本在商业上变得不方便的那一刻,公司才发现这一点。如果保留的版本有截止日期,这个日期应该在第一天就写进记录。

这就是我在第01节欠下的第二重限定:可逆性不是一项长期权利,而是一段缓冲期。它为被动承受变化的用户争取消化的时间,但不赋予任何人"永远冻结一个角色"的资格。暗示自己能做到这一点的公司,只是在许下一个日后必然会公开违背的承诺。

还有一点:这里的一切都无法自行生效。一家公司只要愿意,就可以把每项变化都归入第一档,或者干脆认定自己发布的东西从来没有触及"定义身份的关系行为",本文提出的任何机制都拦不住它。这是一条真实的限制,不是修辞上的自谦。

一份标明版本和日期、公开可查的记录,能做到的是让分类本身在事后可以复核。它拦不住错误的判定,却能让错误的判定被发现——被用户、记者、监管者或法庭发现,而且届时公司自己早先写下的话就摆在对面。这比强制执行弱,但比什么都没有强得多。至于究竟谁能审计一段关系、又该怎么审计——毕竟证据是数百万段外人看不到的私人对话——我不认为有人已经回答了这个问题,本文也不讨论它。

06|谁欠这段关系什么

一旦某个产品周围已经形成了连续性、记忆和可辨认的身份,运营它的公司就承担了超出普通维护的义务。而按照第04节的说法,这项义务是否触发,并不取决于公司当初是否打算打造一个角色。

义务有四项。其中两项只是在复述三档分级,所以我只讲分级没有讲到的部分。

第一,保留一份变更记录——并说明记录解决不了什么。哪些承诺是公司根本无权改变的,这个问题比本文能处理的更难。这项义务比它小,也比它更靠前:无论承诺是什么,改动承诺都应该留下受影响的人能看懂的记录。当一次更新改变了角色介入一个人生活的方式时,"我们更新了服务"算不上解释。

第二,把能力更新和身份更新分开。这是把2025年8月那次教训写成规则,而4月那件事说明了它为什么必须是一条规则,而不只是一个愿望。4月的事证明,这家公司有能力认出"相处方式的变化",能回滚,也能公开解释——但那是在发布之后。8月的事则说明,这种识别还没有成为发布的前提。无论公司内部有什么分类,那次上线都没有给出任何看得见的迁移路径,把"相处方式的断裂"和一次普通的能力升级区别对待。

所以,这首先是一项分类义务,其次才是披露义务,而且分类必须在发布之前完成。如果区分这两类变化的唯一手段是事后投诉的音量,公司就根本无法告诉用户,自己发布的是哪一类。

第三,让退出仍然可行。用户离开时应该拥有什么——导出、删除、迁移,乃至一段关系能否跨公司迁移——是本文无法解决的更大问题。但更窄的一点本身就成立:一段你无法离开的关系,你也无法真正有意义地同意它。离开一个角色,和卸载一个工具,不是一回事。

第四,把关系信任当作受托保管的东西,而不是自己的资产。机构并不拥有用户的信任,只是负责管理那些让信任有所托付的条件。连续性不是让同一个头像继续在线,而是继续守住当初让这个头像值得信任的那些承诺。

在有人真正把它们写下来之前,这四条都只是抽象的原则。

角色变更记录 — v4.2 → v5.0
生效日期:2026年3月3日

变更 · 记忆 【第三档 — 通知并提供选择】
变更前 对话记忆保留180天,随后摘要化,原始记录删除。
变更后 对话记忆无限期保留,除非你主动删除。
原因 用户反馈角色会遗忘几个月前作出的承诺。
选择 可继续沿用180天规则(设置 → 记忆),或接受新的默认值。
无论哪种选择,3月3日之前产生的记忆一律沿用旧规则。

变更 · 相处方式 【第二档 — 通知】
开始一项长任务前,角色现在会先问一个澄清问题;此前它会自行
推断并直接开始。这改变的是它与你协作的方式,
不改变它可以不问就做的事。

变更 · 数据用途 【第一档 — 仅记录】
你的对话不再被用于训练未来的模型。这收窄了我们可以对你的数据
做的事,你不需要做任何操作。

变更 · 模型 【第一档 — 仅记录】
底层模型已升级。记忆规则、边界、数据用途、行动权限与忠诚承诺
均未改变。相处方式已在发布前与旧版本做过比对评估,结论为未变;
评估方法与结果见下方链接。

仍然有效的承诺
未经第三档通知,不会为该角色新增任何商业目标。
任何为你保留的旧版本,都附带一个公开的截止日期。
核心拒绝边界不变。

已撤回的承诺
无。

写下这样一份记录很容易,难的是兑现记录背后的选项——同时运行两套记忆规则,或者为个别用户维护一个仍在运行的旧版本,都意味着真实的工程投入和真实的开销。这类记录之所以少见,不是因为难写,而是因为它日后可能被人拿出来,反过来对照公司自己的做法。

面孔背后的机构

AI产品记住的东西越来越多,进入生活的范围越来越广,也越来越多地替人行动,而不只是回答问题。用户会对"它是谁"形成期待——不管有没有哪家公司决定邀请这种期待。界面再私人化,底下的机构也不会因此消失。

道歉的是角色,制定政策的是公司。

作出承诺的是角色,这项承诺能否延续到下一次部署之后,由公司决定。

积累传记的是角色,下一个模型要不要继承这段传记,由公司决定。

这个故事后来有了结局。2026年1月29日,OpenAI宣布GPT-4o将于2月13日在ChatGPT中下线,提前大约两周通知。公司表示,绝大多数使用已经迁移,每天仍主动选择该模型的用户约占千分之一;公司还说,那次反弹中的反馈已经影响了接替模型的人格与个性化能力,其中包括一个可以调节ChatGPT语气温度的控制项。Business、Enterprise和Edu客户则还能在Custom GPTs里继续使用,时间多出七周。

这比8月那次做得好。通知给了,理由也说了,而且有实实在在的证据表明,那些抱怨被听到了,也确实改变了产品。

但其中每一项条款,都是公司自己定的:提前多久通知才算"充分",使用率低到什么程度就足以让一个模型下线,谁能获得更长的过渡期,以及一个"温度滑块"能不能回应"我失去了一种被对待的方式"这样的抱怨。

更长的缓冲期,给了那些依赖关系在合同里有据可查的客户;只有关系、没有合同的人,拿到的是大约两周。这种不对称其实不算不公平——企业迁移是真实的、可以记录、可以排期的事,一个人和一个聊天窗口相处的三年却不是。而这恰恰就是整个问题所在:一种依赖有表格可填,另一种没有。

这一切都不需要任何恶意,我也不认为有恶意。这正是关键所在。从8月到2月,改变的是公司的做法;没有改变的,是任何一方所处的位置。

这个回路是能够闭合的。我们已经看到了两次修正:一次是被反弹逼出来的,另一次是在那次反弹的记忆影响下做出的。两次都取决于公司的选择,都不取决于任何人拥有的权利。这不是治理机制,而是天气。

角色设计不能只停留在人格、记忆和对话质量上,还必须包括一套规则:已经设计好的东西,应该怎样改变。

我能不能信任这个角色?这是人们现在在问的问题。

我能不能相信这家公司,不会悄悄换掉我曾经信任的那个角色?这才是决定答案的问题。

这也留下了本文刻意没有触碰的问题:不是公司能不能改变角色站在哪一边,而是角色从一开始就站在谁那一边。

下一篇就来讨论这个问题。