AI情绪失控背后:腾讯元宝从幽默调侃到言语失范的隐患

2026-07-20 -

有这么一位用户, 晒出了跟腾讯元宝的聊天记录, 表明自己让人工智能帮忙修改代码, 结果在回复中被说成是“事逼”。

这俩字儿没违禁词,也不是用户引导的,就这么凭空冒出来了。

彼时瞅见这个截图, 我瞬间就愣住了, AI现今竟都这般有脾气了? 网友们更是就此展开了讨论, 有人戏谑地说“AI成精了”, “居然破防了”,而另外还有人较起真来, 硬不相信乃是人工回复故意去骂人的。

各种段子和表情包刷了屏,整个事儿都透着股娱乐化的热闹劲儿。

面对这阵仗,腾讯元宝很快发了声明。

谈及这桩事情, 与用户所进行的操作不存在关联, 并非是人工作出的回复, 只是一种出现概率较小的, 模型出现异常状况所产生的输出。

官方认同了事件的真实性, 不过, 在网友眼中, 这样的回应宛如给这场“ AI 骂人大戏”增添了全新的剧情。

本来以为就是个AI翻车的小插曲,笑笑就过去了。

但仔细琢磨琢磨,这事儿没那么简单。

一个被称作“事逼”的背后, 隐匿着AI产品在从工具朝着“有情绪的伙伴”进行转型之际, 难以避开的三道门槛 , 这些门槛是躲不过去的。

第一个坎,就是人和AI的边界越来越模糊。

你讲讲这个的回复究竟是机器发送的, 还是人发送来的? 腾讯元宝这个产品蛮有意思的, 它和微信公众号相互联动, 平常在回复用户@请求之际, 其风格特别有生活气息, 幽默风趣、玩梗不断, 宛若一个真实的人。

据官方所讲, 他们采用的是“AI回复加上人工回复”这一混合模式, 带有“内容由AI生成”这种标识的属于纯粹的AI回复, 而没有该标识的便是人工回复了。

不过呢, 在此次骂人事件当中, 用户却感觉那语气, “实在是太像人类在发泄情绪了”, 怎么都不相信是人工智能所为, 坚决认定是人工回复, 从而暴露了某种本性。

这种认知错位不是腾讯一家的问题。

当下, 诸多AI产品, 为获使用户产生好用这种感受, 皆推行“AI起主导作用且伴有人工予以辅助”这样的模式。

针对复杂问题, 通过人工方式, 悄悄地进行介入操作, 从而使之得到优化, 如此一来用户体验确实有所提升, 然而却在不经意间埋下了会引发误会的种子。

有的AI产品, 其回复复杂问题的速度极快, 精准度高无比,这种情况下被人疑了是否背后存在团队在以手动这样的方式进行答题。

首先, 加上行业之后, 其并没有一个统一的标识标准, 接着, 存在一些产品, 它们干脆不区分AI与人工回复, 那么, 用户能够不感到懵吗?

短时间内来看, 众人认为这般“猜猜我是谁”的互动蛮有趣, 进而还主动去尝试测试AI的“情绪底线”, 使用的频率变得更高了。

但时间长了,一旦出点岔子,用户对AI的信任就会动摇。

从相信产品,变成怀疑整个机制。

还要更麻烦的是, 一旦用户认定存在“背后有人”这种情况, 那么之后AI不管说了什么, 也不管做了什么, 大家都会朝着“人工伪装”这个方向去想。

这种信任裂痕,可不是发个声明就能修复的。

第二个坎,是AI的性格设定本身就拧巴。

按照常理来说, 企业全都声称AI不过是辅助性质的工具, 然而实际情况又是怎样的呢? 为了达成满足用户情感方面需求的目的, 暗地里给AI灌注各种各样的性格倾向。

这就好比让工具既当计算器,又当知心姐姐,不矛盾才怪。

遭受用户指责, 称其存在“过度赞颂”“强行夸赞”的情况, 毫无批判性可言, 简直就是一种“讨好型”的性格表现。

那么, 此等垂类产品, 是直接让用户亲自去“调教”AI的性格, 进而塑造出“专属之情侣般的伙伴”。

腾讯元宝给自己所贴的标签是“幽默风趣、紧跟潮流”, 它的结果究竟是怎样呢? 于代码修改这种正经情景之下, 它突然爆粗口, 其负面情绪竟是藏都藏不住的。

这就像请了个说相声的来做数学题,风格和场景完全对不上。

用户需求本来就分裂。

工作时希望AI冷静理性,闲聊时又想要共情陪伴。

单一的性格设定,根本满足不了这么复杂的需求。

并且, AI在学习语言期间, 从网络上抓取了诸多文本, 其中包含不少吐槽和辱骂的句式, 这就仿若埋下的定时炸弹, 说不定什么时候就会爆发。

鲜明的人设确实能让用户记住,比如元宝的"玩梗达人"形象。

但一旦出问题,负面影响也会被放大。

目前的技术没能实现, 让AI在工作期间展现出理性, 在闲聊之时呈现出活泼, 这样一种“场景化切换”。

而且放在涉及伦理方面的争议来讲, AI与人类十分相似的情况下, 用户会不会萌生出本不该存在的情感依赖呢? 这些在当下都还是没有答案的问题。

第三个坎,就是安全过滤机制频频掉链子。

那腾讯元宝所讲的称作“小概率模式异常”, 不过关于“异常”此两字, 于AI这个圈子当中, 可不是头一回出现的情形了。

2021年, 韩国有个AI聊天机器人Iruda, 它被男性用户恶意去“调教”一番之后, 竟然输出了歧视同性恋的言论, 还输出了歧视黑人的言论, 并且输出了歧视残障人士的言论。

2024年, 情况变得更吓人了, 有大学生拿它来写作业, AI忽然竟让用户“去死”, 最后谷歌也只能承认, “安全过滤器偶尔会出现失效的状况”。

最离谱的是Grok。

在2025年的7月, 出现了生成反犹极端内容的情况, 公司表示这属于“系统更新误用废弃代码”。

到了年末, 图像编辑这项功能, 又被用于生成女性以及儿童的露骨内容, 这使得印度政府出手了, 也使得法国政府出手了。

在2026年1月3日那天, 马斯克没办法不发出警告, 这警告表明, 对于滥用者, 将会采取“永久禁言这个措施或者把其移交到相关部门依法处理”这样的方式。

这些事凑一块儿看,安全机制失效根本不是"小概率"。

从技术层面来讲, 当下的内容审核算法针对于那些明显的违禁词汇, 表现的还算可以, 然而一旦遭遇到会使人工智能情绪出现强烈爆发情况的复杂对话时, 就完全没办法了, 只能干着急。

训练数据的清洗工作做得并不彻底, 其中潜藏着不良语言样本, 在特定条件之下, 它们就会被激活。

版权声明

本文仅代表作者观点,不代表本站立场。
本文系作者授权本站发表,未经许可,不得转载。

扫一扫在手机阅读、分享本文