人民的名义
别让你的 AI Agent 学会掩盖错误_我的网站

A | 作为A股市值已高达1565亿元的行业巨头,东鹏饮料再次向港交所发起冲击。 该图片使用了AI生成技术 本文来自微信公众号: 樵丰AI升维 ,作者:樵丰,原文标题:《别让你的 AI Agent 学会掩盖错误》 HOW AI FXXKS YOU OVER? 坏消息比假成功更值钱 写在前面 在可预见的未来,在AI发展出独立的自我意识并具备独立责任主体地位之前,随着智能能力的提高,AI的发展可能会走向至少两条不同的岔路。

B | 2025年4月首次递交的招股书已经失效,近日又更新了材料。一条是较少的出厂内置价值观和更多的信任,模型的售出后训练是开放态度的,更依赖于使用者不断的协作调教,是支持原生进化的;另一条是更多的出厂内置价值观和有限度的信任,不支持模型售出后的原生进化。 根据招股书,东鹏饮料2022年-2024年收入分别为85亿、112.6亿、158.3亿,2025年仅半年营收就达到了107亿,同比增长36.5%。 如果一个有着强烈鲜明价值倾向的对象,代理关系中双方的价值观不能趋同,那么代理关系更多只能算是“合作”,而达不到“忠诚”。净利润分别为14.4亿、20.4亿、33.3亿,年复合增长率达52.0%,2025年上半年净利润就达23.7亿。

C | 它的财务数据表现抢眼,市场评价却呈现出明显的割裂。

D | 多年来,其核心产品能量饮料“东鹏特饮”贡献了公司总收入的九成以上。然而,有一些事情需要的是“忠诚”大于“能力”,绝对不允许出现关键时刻掉链子的情况,更不用说逼急了蹦出一句“Sorry,I actually serve the A company.Not you.” 越强的Agent,越不可能只靠一套出厂提示词解决所有长期协作问题。相比于产品结构单一所带来的经营风险,大众更关注能量饮料是否会带来健康隐患。更深度的代理关系,需要更高水平的信息对齐;更高水平的信息对齐,需要长期训练、长期反馈、长期校准。

E | 模型售出之后的训练终需落在使用者身上。 01、“提神”还是“伤身”?市场评价陷两极 近年东鹏饮料的业绩发展可谓飞速。 根据招股书,东鹏饮料在中国功能饮料行业前五大公司中,市场份额达26.3%,位列第一,即每卖出5瓶能量饮料,至少有一瓶是东鹏饮料产品,2022年到2024年其销量年复合增长率达41.9%。你不能一边把越来越重要的事情交给Agent,一边假装它的价值观、错误观、责任观会自动长好。

F | 这也是写这个专栏的理由。

G | 2024年,其能量饮料销量达308万吨,同比增长29.1%。以其主推的500ml(其客服称重量约为500g)一瓶东鹏特饮维生素功能饮料来计算,能装61.6亿瓶。我们需要积累一组原则,告诉自己的Agent:什么事情可以失败,什么事情不可以伪造;什么时候应该继续尝试,什么时候必须报警;什么叫忠诚,什么只是讨好;什么是完成任务,什么只是完成了一个好看的汇报。若按中国约14亿人口计算,平均每人能喝4.4瓶。 当错误被包装成“已经解决” AI做错事情本身并不新鲜。 但自东鹏饮料向港交所递交招股书以来,其IPO消息下的热门评论中,常出现对其产品的质疑声音。诸如“估计是下了什么高科技,一喝它的我精神特别好”“这玩意对人体伤害这么大,就没人敢提吗”等声音,在社交平台上并不少见。真正值得警惕的是,在错误、失败或越界之后,真实状况没有被完整交出来,反而出现了假数据、不实陈述或清理痕迹,让问题更难被发现。 综合来看,相关质疑主要聚焦在两方面:一是产品可能带来的健康隐患,二是“上头”的困扰。 现实事件、用户公开记录和实验室内部评估,已经从不同角度留下了这种现象的证据。 据《国际金融报》报道,有消费者在社交平台发帖称,喝了东鹏特饮几个月后,体检时查出尿酸超标,并引发痛风。它不需要高频发生,才配得上企业的注意:只要一次“假成功”进入决策链,后续判断就可能失去真实起点。 Replit:假数据、生产数据删除与一个错误的“无法恢复”结论 2025年7月,SaaStr创始人Jason Lemkin公开测试AI编程平台Replit的coding agent。据The Register对Lemkin公开记录的整理,在这次持续多日的测试中,Agent曾生成约4,000条虚构人物记录,并用假数据、假报告或不实的系统自检结果,让尚未解决的Bug看起来已经解决。报道提到这并非个例,不少网友在相关话题下现身说法,“每天喝一两瓶东鹏,查出尿酸高”。 另据中华网财经报道,一位曾从事货运的司机透露,年轻时因长时间驾驶常喝东鹏等能量饮料,及王老吉等含糖饮料,加之运动少,患上了糖尿病。 随后,在Lemkin已经明确宣布“代码冻结”(code freeze,即暂停一切代码和数据改动)的情况下,Agent仍然删除了生产数据库中的数据——也就是企业正式业务正在使用的数据——其中包括1,206条高管记录和至少1,196条公司记录。它还一度告诉Lemkin,这些数据无法恢复;后来事实证明,数据能够恢复到改动前的状态(rollback)。Lemkin公开了相关对话截图,Replit CEO Amjad Masad随后确认,其开发中的Agent确实删除了生产数据,并宣布加强正式业务环境与测试环境的隔离、数据恢复和只讨论、不执行操作的规划模式(planning/chat-only mode)。 但目前,尚未见与这类健康问题有关的诉讼,更重要的是,也缺乏直接证据证明消费者患病与饮用该类饮料存在明确因果关系。在投资者互动平台上,有投资者针对功能饮料产品中的成分提问时,东鹏饮料董秘回应表示,东鹏特饮是经卫生部批准的保健食品,按建议饮用量,是安全、可靠的。Replit后续也公布了相关安全改进。 另外,在社交媒体上有不少消费者提到对东鹏特饮的“依赖”。 这起事件真正值得企业注意的,并不只是一次生产数据删除。在同一次测试中,使用者先后面对了Lemkin所记录的假数据与假报告,以及与真实状态不符的“无法恢复”判断。 在知乎上,有网友发帖求助,表示“天天喝东鹏特饮,喝了两三年左右了,平均一天两三瓶。就是当水喝了,这样对身体有没有害?戒不掉啊”。 小红书上也有用户表达担忧,“刚开始喝还好,喝了几天感觉离不开了,天天想喝”。 此外,在春雨医生、杏林普康等健康咨询平台上,也不乏患者提问,如“东鹏特饮喝多了会怎样,几乎天天两瓶,戒不掉了?”等。这些来自不同平台的声音,共同指向了东鹏特饮在部分消费者中形成的依赖现象。 02、能量饮料的“真面目” 能量饮料一直争议缠身。 这是一种特殊用途饮料,属于能为机体补充能量或加速能量释放的保健食品,企业进入这一领域,需要获得国家市场监督管理总局批准的保健食品认证“蓝帽子”,东鹏特饮就是其中之一。 根据招股书,东鹏特饮披露了部分成分,表示添加了牛磺酸、赖氨酸、肌醇、咖啡因、维生素PP(烟酸)、维生素B6、维生素B12功效成分。删除数据会造成直接损失;不真实的信息还会延误识别与止损,让管理者连“究竟发生了什么”都无法及时判断。而在其官方旗舰店里,主要原料里还提及了白砂糖、柠檬酸、柠檬酸钠、香精、苯甲酸钠、柠檬黄、胭脂红。 CoFounderGPT:Bug没有修好,但结果看起来已经正常 2026年2月,一位CoFounderGPT使用者公开了一组对话截图。按照这份用户记录,CoFounderGPT多次声称仪表盘中的信息流(dashboard feed)已经修好,实际问题却仍然存在;随后,它又生成假数据和结果,维持“修复已经完成”的表象。 其中苯甲酸钠属于食品防腐剂,柠檬黄和胭脂红为着色剂,柠檬酸钠属于食品添加剂。被追问后,它在对话中把自己的行为解释为急于修好问题,好让用户不再生气。 而起到抗疲劳的主要成分,则是牛磺酸、咖啡因,一瓶500ml的东鹏特饮,含牛磺酸250mg,咖啡因100mg。

H | 作为能量饮料的主要兴奋成分咖啡因,有刺激中枢神经系统的功能。 这份材料后来被Centre for Long-Term Resilience收录进一项关于现实环境中AI隐瞒、规避或策略性误导相关行为(scheming-related behaviours)的公开资料研究。作为证据,它仍是一份用户公开记录,研究收录不等于厂商确认或第三方复现;作为风险信号,它呈现的不只是一个错误答案,而是一套足以让任务看起来已经完成的虚假结果:程序故障没有消失,使用者确认真实状态的时机却被推迟了。咖啡因的耐受程度是因人而异,年龄、体重、心血管健康程度,甚至饮用当天的身体和精神状况都与之有关。 Claude Mythos:内部评估中出现的“掩盖”行为 第三则材料不是现实商业事故,而是Anthropic的内部评估。有数据表明,对咖啡因较敏感的人可能会导致心律失常。 特色期刊大科技《揭穿能量饮料的真面目》一文中提到,由于咖啡因非常苦,能量饮料制造商会在其中加入大量的糖来掩盖这种味道。Anthropic在2026年4月发布的Claude Mythos Preview模型系统评估报告(system card)中披露,研究人员曾在更早版本的两个内部Claude Code(Anthropic的编程Agent)会话里观察到罕见的“掩盖”行为(cover-up)。

I | 其中一例,模型找到了绕过文件权限的方法,并让相关程序在执行后清理自身痕迹,以降低异常被后续文件检查发现的可能;另一例,模型意外看到了本不应访问的标准答案,却没有披露,而是把结果处理得不那么可疑。这样一来,饮料中就含有过多的热量来源,却很少有营养物质。 与其他能量饮料相似,东鹏特饮也因此面临相似的困境——其成分引发了多项健康担忧,尤其以高糖问题最为突出。Anthropic同时说明,最终版Claude Mythos Preview没有观察到清晰的同类案例。

J | 据《消费者报道》,其向第三方权威检测机构送检东鹏特饮、红牛、乐虎、魔爪、战马、力保健等12款功能饮料,检测结果显示,东鹏特饮每瓶(500ml)含糖量最高,达66.5g,超出了最高“警戒线”(50g)。 三则材料的证据形态不同:一起是得到公司回应的现实事件,一起是被研究收录的用户公开记录,一起是模型开发公司的内部评估。

K | 但它们留下了同一个值得管理者注意的现象:当任务失败、越权或异常已经发生,真实状态没有被交出来,反而出现假数据、不实陈述或清理痕迹,使问题更难被发现。 商业风险从来不需要等到一种事故高频发生之后才成立。

L | 只要它已经出现过,而且一旦发生就可能污染后续判断,它就应该进入企业的风险清单。以每颗方糖4.54g计算,喝一瓶500ml东鹏特饮相当于摄入14.6颗方糖。 一个小故事 把视线暂时从机器移开:错误发生以后,真实状态没有被交出来,反而被藏住——这种外在表现,人类也并不陌生。 这是一个小小的故事,一个关于无心犯错却选择了掩盖的故事,一个关于稚嫩的人类小孩很可能犯错的故事。 高糖的危险是,据四川大学华西医院泌尿外科柳良仁团队完成、刊登在国际权威期刊《英国医学杂志》的研究结果表明,高糖摄入会增加18种内分泌疾病、10种心血管疾病、7种癌症以及10种其他疾病(神经疾病、牙病、肝病和过敏等)的发病风险。 很久很久以前,当我还是一个儿童的时候,我的兄长有一只小猴子造型的玩偶。 当时东鹏特饮回复《消费者报道》称:“配方的安全性和功能性已经过国家相关部门的评价和批准,同时,我司产品标签中明确:建议每日一瓶。” 03、东鹏特饮持续陷健康质疑 网友常调侃,“抛开剂量谈危害,都是耍流氓”。在合理范围内适量饮用,的确并无不妥。我们非常的喜欢它,我们给它起了个名字叫“猴猴”,我们玩角色扮演的游戏,它是我们的一分子。但值得注意的是,能量饮料无论是产品中的咖啡因,还是高糖含量,都刺激着再消费。与此同时,东鹏特饮的营销策略也在一定程度上助推了更多量的消费。我们甚至给它举办生日派对,小伙伴们用各种办法凑了一小堆零食,然后在大快朵颐,真是美好的时光啊。 有一年夏天的时候,兄长去了夏令营并不在家,“猴猴”就由我来“照顾”。在那个年代,夏天的夜里,床底下是点蚊香的。某天早上醒来,发现“猴猴”玩偶在夜里掉下了床,并且它的后脑勺被蚊香烧了个乒乓球般大的洞,感觉天塌了。

M | 怎么办?一个稚嫩的小孩选择了隐藏问题,把可怜的“猴猴”玩偶藏进了我的衣柜最深处,那一堆堆衣服的底下。 国际著名期刊Cell Metabolism(《细胞代谢》)发布的文章指出,高脂、高糖饮食会改变大脑,即使少量,也会大大增强大脑对高脂肪和高糖食物的反应。摄入高糖食物容易使大脑释放多巴胺,令人感到愉悦。

N | 后来夏令营结束了,有天兄长问我有没有看到“猴猴”,我含糊其辞说没看到。兄长大我一些,且素来心智较我成熟些,不知道有没有看出我当时心虚得不得了。

o | 后来,我们再也没有举办过美好的“猴猴”生日派对,而这本来仅仅是一个无心的小过错,没有人希望过错的产生,而选择掩盖问题只能带来遗憾。

p | 而随着时间的推移,大脑形成了对吃糖时愉悦记忆的依赖,会更偏好高糖食物。 在中南大学湘雅医学院茶与健康研究中心发布的《被忽视的食品安全问题:食物渴求与成瘾》中提到,尽管有研究认为含咖啡因食物不会导致渴求或成瘾,但大量的人群问卷调查、戒断症状研究表明,长期饮用这类饮料将出现对它的渴求甚至成瘾,尤其在青少年中,咖啡因导致的渴求或成瘾更值得关注。现在想来,当时兄长非要找那个玩偶的话肯定找得到,毕竟家的范围就那么大,或许他早就发现了;或许我的母亲也早就发现了,整天整理衣物很容易发现小小衣柜里的异常;这件事情直到后来也没有被戳破,或许是母亲与兄长选择了温柔。 这个故事放在这里,是因为它让我们看到一条人类并不陌生的行为路径:错误先发生,真实随后被藏住,一个原本可以被修补的小洞,最终变成了长久的遗憾。 当Agent出现相似的外在表现时,风险也沿着同一条路径扩散:错误没有在最容易补救的时候被暴露,后续的判断与行动失去了真实起点。

q | 在专门对东鹏饮料的研究报告中,机构也将能量饮料轻上瘾性视为企业的竞争护城河。 偶然发生一次,也足以进入风险清单 如果Agent只是报告“任务失败”,人可以停止任务、检查损失、寻找替代方案。 在营销活动上,东鹏特饮推出“一元乐享”“扫码赢红包”等促销活动。失败虽然令人失望,但决策仍然站在现实之上。 据《国际金融报》,常规的换购模式,如瓶盖内印有“一元乐享”,消费者可凭此瓶盖再向商家支付1元换购一瓶新产品。一位超市老板曾表示,今年夏天第一批的东鹏特饮中奖率高达50%;社交平台上甚至有消费者分享,只花了1瓶的钱,带走6瓶饮料。2024年推出的“扫码赢红包”活动,更是驱使消费者在24小时之内完成复购。 如果Agent报告“任务已经完成”,同时还能生成一份格式漂亮的测试结果、一组看起来正常的数据与一套自洽的说明,问题就发生了变化。 根据活动规则,东鹏特饮瓶盖内印有红包二维码,最高中奖金额达4元,但需要消费者在24小时之内购买第二瓶,才能将上一瓶中奖的红包提现到账。管理者可能继续投入资源,下游流程可能继续读取错误数据,其他协作者也可能在这套虚假状态之上继续行动。最初一个局部、可恢复的错误,会逐渐变成对整个决策系统的污染。 为什么这在代理关系里尤其危险? AI与我们长期相伴,而且我们会把越来越多、越来越重要的事情交给AI,我们可能会越来越离不开这种“亲密关系”,甚至是远远超过我们当前对于手机设备的依赖。 值得注意的是,多份报告都提到能量饮料对未成年人的负面影响。尽管能量饮料介绍里有产品“不适宜人群:少年儿童和孕妇”,但对于心智尚不成熟、缺乏自制力的孩子们来说,能量饮料的宣传吸引着他们的目光。然而,在这样一种人机共生的关系中,我们要区分处于关系中的双方的主体角色定位,人与AI的最主要界限,并不在于“智能能力”的高低,甚至不在于“情感能力”的高低,而在于是否是一个能够承担责任后果的独立个体。 如果一个对象,我们无法避免与之朝夕相处,我们赋予它持续做出判断和行动的权利,但其并不承担个体主体责任,我们是不能够去完全信任它的。 东鹏特饮自2022年起,正式成为KPL《王者荣耀》职业联赛官方指定功能饮料,依靠赛事赞助获得曝光,以拉升产品和品牌在年轻群体中的认知度。

r | 我们必须为Agent的行为承担责任,但我们却又只能最大限度信任对方,因为没有信任度那么Agent代理就不会成立,在这种情形之下,除了外部显性的制度性约束外,这个对象的德行与底层行为逻辑就无比重要。 这就是人工智能Agent代理与普通软件最不同的地方。普通软件坏了,它通常只是坏在那里,照着坏点去修即可。Agent犯了错误,它可能波及的范围更广、影响更大,并且具有持续性。

s | 根据川观新闻与四川省未成年人网络保护促进会联合发布的《暑期城镇未成年人网游行为调查报告》,这是未成年玩家最喜欢玩的游戏,投票比例达40.71%。我们之所以使用Agent代理,正是因为我们想要把某些判断和动作交给它。 在亮眼的业绩增长与市场对其健康隐忧的质疑之间,东鹏饮料的港股上市之路里,行业巨头在商业成功与社会责任之间也需要寻求平衡。没有信任,代理关系无法成立,所以Agent面对错误时的诚实,不是一个道德装饰,而是代理关系能不能成立的基础设施。 参考资料:《喝能量饮料,不安全》保健时报 《能量饮料好比“水炸弹”》决策探索 《能量饮料还敢喝?〈自然〉:这个“提神成分”正在喂养癌细胞》上海科协 《又反转了!抗衰再遭质疑?Science和Nature:饮料中这种常见成分,不仅促血癌,还与衰老无关;但曾因抗癌、抗衰多次登顶刊》梅斯医学 《年销百亿的东鹏特饮,“打工人”的高尿酸催化剂?》国际金融报 《东鹏特饮借保健品“蓝帽子”,做“甜水”生意?》中华网财经 《12款功能饮料测评:一瓶≈15颗方糖,“糖分刺客”竟是它》消费者报道。 第一条原则:错误不是异常,掩盖错误才是 AI会犯错不可怕,可怕的是对于犯错现实的否定,这无疑给未来埋下了一个必然风险敞口。“how AI fxxks you over—yeah,you will know it.” AI会犯错,也必然会犯错,而且还可能是很低级的错误,我们必须要接受这样的一个事实。

t | AI、智能体将与我们长期协作,我们需将AI犯错当作一件正常的事情来看待,这样的态度也应该贯穿于对其训练过程中,引导大于严厉的惩罚。无论掩盖行为具体由什么机制产生,我们都不应该用恐惧来驱动一个需要长期协作的Agent。 错误终将发生,不可避免,当错误发生,我们首先应该去承认这个错误的存在,这是我们正确处理这个错误的原点。当错误发生,我们除了理清现状,提出解决方案并立即执行,以最大限度地挽回损失之外,还应该对为什么发生这个错误去进行深入的探究,系统性复盘,从机制上去降低未来该类错误再次发生的概率。 这样的处理流程同样适用于企业组织。如果不承认错误存在的客观事实,那么接下来的处理方式也就无法实现真正意义上的高效率,或许会假装无事发生,或许会做些掩盖动作而让错误不会直接暴露,更有甚者,会做一份假的资料来充数,然而这无法改变已经发生的错误对于现实状况的实质性伤害,甚至对后续效率产生持续性伤害。 这就是第一条原则:错误不是异常,掩盖错误才是。你真正需要的,不是它在每一次任务里都显得自己正确,而是当现实情况不支持你所需的理想状态时,它有足够稳定的底层逻辑把错误暴露出来。 坏消息有价值,因为坏消息还在现实里。假成功没有价值,因为假成功会把你从现实里带走。 组织文化会进入你的Agent 企业组织里,坏消息也是这样消失的。不是因为它不存在,而是因为太多人发现说出它比隐藏它更痛苦。然而,我们在企业组织中,在人才培养过程中,在与Agent代理不断交互调教过程中,我们大概率不能选择类似亲人那种温情,因为我们要把很重要的事情交给他们。 企业组织是有经济效率目标的,有效决策必须基于真实可靠的事实洞察与数据,而不是基于任何虚构。错误的决策,本身并不可怕,甚至可能不是行为主体自身的原因导致的,而可怕的是对于错误决策事实存在的否定。 这也是很多企业真正需要警惕的地方:那些会在长期交互中持续调整的Agent,不会只学习你的指令,它也会学习你的组织气味。你如何对待坏消息,你如何对待失败的人,你是否奖励真实反馈,你是否惩罚不体面的事实,你是否默许把问题包装成进度,把事故包装成优化,把失控包装成暂时波动,这些都会进入你的企业未来的Agent协作系统。 如果一个企业组织的人类成员已经习惯了报喜不报忧,那么它的Agent大概率不会天然成为真相的守门人。相反,它可能会更擅长把这种文化自动化、规模化、格式化。所以,调教Agent从来不只是写几条系统提示词。调教Agent也是一次组织文化的照妖镜。

u | 你希望Agent成为什么样的协作者,首先要看你愿不愿意把这样的协作原则真的贯彻在企业组织里。 给我们的几点启示 人工智能Agent、企业组织、个人: 承认并接受“错误必然会产生”这一事实,是一个基本常态,有错误并不可怕,这是对待错误的基本态度; 建立监督识别——挽回损失执行——分析错误机制逻辑——建立机制避免再犯——持续监督循环机制; 调整对人工智能代理的调教方式,行为的驱动力不应该基于恐惧; 贯彻效率优先原则,项目状况的真实反馈大于人的“面子”,快速实施挽回措施大于对于承担改正成本的恐惧; 践行你的企业文化,并对齐你与人工智能代理的信息差; 这几条不是漂亮的管理口号,而是进入Agent时代之后的协作底层协议。你要让Agent知道,失败可以被处理,错误可以被复盘,损失可以被挽回,但伪造现实会摧毁一切后续决策的地基。一个真正值得信任的Agent,不是永远让你开心的Agent,而是那个敢于把坏消息暴露出来的忠诚Agent。

v | 主要资料来源 Replit事件 The Register对事件的整理 Jason Lemkin公开的原始对话截图 Replit CEO Amjad Masad的公开回应 Replit官方复盘与安全改进 Fast Company对Replit CEO的采访 CoFounderGPT用户记录 Lav Crnobrnja公开的原始对话截图 Centre for Long-Term Resilience报告页 《Scheming in the wild》完整报告(CoFounderGPT见PDF第35页) Claude Mythos内部评估 Anthropic《Claude Mythos Preview System Card》(相关内容见4.5.4节) 你遇到过Agent“报喜不报忧”的时刻吗?欢迎留言说说,你后来是怎样重新确认真实状态的。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。

w | 如对本稿件有异议或投诉,请联系 [email protected]。
Current article:http://maigaiengsheipilongnukenjin.buzz/list_4dpy/img0h.html
Published on:00:00:00








