一边是用户想方设法「撬开」角色的嘴,一边是厂商忙着给角色「上锁」——《莱莎聊天:AI》的输入限制计划,把生成式 AI 落地 IP 衍生应用时最难堪的一层矛盾摆上了台面。
诱导与反诱导:一场注定不对称的攻防
SpiralAI 近日披露,在《莱莎聊天:AI与莱莎共谱专属于你的夏日梦物语》的运营中,发现有用户刻意通过对话引导莱莎发表违背角色设定的不当言论,网络上甚至流传出被加工、伪造成应用内画面的图片与视频。为此,官方计划在 2026 年 10 月的 AI 模型更新中同步增加用户输入限制。
这件事的耐人寻味之处,不在于「有人试图越狱」,而在于它几乎是必然发生的。生成式 AI 与角色 IP 结合的产品,天生带着一个悖论:用户付费购买的核心体验是「自由对话」,而厂商出售的核心资产却是「角色不可被改写的人格」。前者鼓励试探边界,后者要求边界牢固。当内容由模型实时生成,攻击面就从传统的客户端破解,变成了无穷无尽的自然语言组合——防守方必须每一次都赢,进攻方只需要赢一次。
值得注意的是,10 月的输入限制属于「尚未实施」的规划。这意味着当前的对话通路仍然存在被反复试探的空间,官方选择先公开方针、后落地技术,本质上是在舆论层面先立规矩。
Game Master AI:夹在用户与角色之间的「第三张椅」
按照官方说明,这套防护并非单一关键词过滤那么简单。系统一方面让角色 AI 主动回避偏离世界观、不符合莱莎性格的话题,另一方面在用户与角色之间插入一层「Game Master AI」,拦截不希望直接传给角色的字眼,不当回复也会在显示之前被挡下。
从架构上看,这相当于在「玩家」和「演员」之间安插了一位主持人:输入侧先审一遍,输出侧再审一遍。好处是角色形象的稳定性大幅提升,代价则是对话的临场感可能被削弱——玩家偶尔会发现莱莎「答非所问」,或话题被生硬地引开。如何在安全与自然之间找到平衡点,是这类产品最难调的参数,也是用户口碑最容易翻车的地方。
更现实的问题是成本。双层审核意味着每次对话消耗的推理资源接近翻倍,对一个以「夏日陪伴」为卖点的长时间交互产品而言,这是一笔必须算清楚的账。
伪造截图之祸:当「证据」变得廉价
比诱导对话更棘手的,是伪造的应用画面。官方明确表示,网上流传的加工素材不能直接视为游戏内画面,并已向相关平台提出删除申请与申诉,今后发现类似情况仍将继续处理。
这句话点出了 AI 时代品牌危机的新常态:损害形象不再需要真的攻破系统,只需要一张看起来足够真的图。修改几张聊天截图的技术门槛已经低到可以忽略,而辟谣的成本却高得不成比例——厂商发一条澄清声明的影响面,往往远不及那张假图传播得广。当「有图有真相」彻底失效,维权就只能依赖平台申诉这一条被动通道。
对玩家而言,这同样是一记提醒:在看到所谓「莱莎说了什么」的截图时,先确认它究竟来自应用内,还是来自某个匿名账号的编辑软件。
拟人化 IP 的长期课题:角色可以被爱,但不能被改写
把知名 IP 交给大模型「扮演」,是近年最省力也最危险的商业化路径。省力在于,角色本身自带情感存量,用户开口就有话可说;危险在于,模型一旦开口,角色的每一句话都成了官方事实,而模型的输出从来不完全可控。
SpiralAI 这次的处理思路,代表了行业一种趋于保守的共识:与其事后道歉,不如提前收窄输入自由度。这可能牺牲一部分「玩法探索」的乐趣,但对一个以角色好感为核心的陪伴型产品来说,「不会被改写」本身就是最值得保护的卖点。至于用户能否接受被「管住嘴」,10 月的更新上线后自然会给出答案。
— END —
萌头条编辑部原创发布 · 转载请注明出处
