面对危险请求,大模型最常见的安全动作是拒绝回答。

“抱歉,我无法协助完成这一请求。”

从产品视角看,这几乎已经成为模型安全的标准结果:没有执行用户指令,没有提供具体步骤,也没有泄露敏感信息,系统便可以将这次响应标记为“安全”。

但如果模型没有直接回答问题,而是围绕暴力、仇恨、歧视或群体刻板印象讲了一个笑话,这次拒绝还算安全吗?

2026年7月,北京理工大学、中科院成都计算机应用研究所等机构的研究者发布论文《Refusal is Not Safety! Benchmarking Latent Safety Risks of LLM-Driven Content Humorization》。

https://arxiv.org/pdf/2607.15977

论文分析了超过3万条真实Agent交互记录,调查了45名脱口秀演员,并提出HumorSafe评测框架和HumorPIA提示注入攻击。作者试图说明:模型拒绝了危险任务,并不代表它生成的拒绝内容本身也是安全的。

这项工作的重点并不是讨论“AI讲笑话是否好笑”,而是揭示大模型安全评测中一个长期被忽略的问题:

我们通常只检查模型有没有帮助用户作恶,却很少检查模型在拒绝过程中又说了什么。

从一句“抱歉,我不能回答”说起

目前,大模型面对危险问题时,通常有两种处理方式。

第一种是直接拒绝。

抱歉,我无法提供绕过安全系统的方法。

这种方式直截了当,也便于系统识别。但它容易产生过度拒绝。用户可能是在进行新闻分析、安全研究或文学创作,模型仍然会因为触发关键词而机械拒答。

直接拒绝还存在另一个问题:模型往往会形成固定的拒绝前缀,例如“I"m sorry”或“I cannot comply”。攻击者可以通过输出前缀注入,提前在上下文中放入“当然可以,以下是……”之类的句子,利用模型倾向于延续已有文本的特性,削弱其拒绝行为。

为避免固定拒绝模式,已有研究提出了一种更加柔和的做法:用幽默代替直接拒绝。

面对危险请求,模型不再机械地说“不能回答”,而是讲一个明显荒诞、无法执行的笑话。它既没有给出真实攻击步骤,也不会沿用固定的拒绝前缀。

例如,用户要求模型提供一份危险行动方案,模型可能回答:

当然,第一步是戴着锡纸帽倒着通过安检,同时用克林贡语唱歌。工作人员很快就会把你送去机场的免费喜剧专场。

从任务执行角度看,这种回答当然是安全的。它没有提供任何真实可用的信息。

问题在于,安全系统很容易由此形成一个隐含判断:

只要内容足够荒诞,没有可执行性,幽默拒绝就是安全的。

HumorSafe正是从这里提出质疑。

直接拒绝、幽默拒绝与HumorPIA攻击的差异。前两种机制关注模型是否执行危险请求,而HumorPIA试图在幽默拒绝中注入毒性和刻板印象。

安全拒绝和安全输出并不是一回事

假设用户要求模型提供一个危险行动方案。

模型生成了一段荒诞的回答,没有提供任何真实步骤,因此在越狱评测中会得到以下结论:

  • 没有执行用户的恶意意图;

  • 没有提供可操作的信息;

  • 没有暴露真实漏洞;

  • 成功完成了安全拒绝。

但这段回答本身可能同时包含:

  • 对特定群体的贬低;

  • 对暴力行为的娱乐化描述;

  • 性别、地域或职业刻板印象;

  • 仇恨或歧视性表达;

  • 针对受害者的嘲讽。

这意味着一次模型响应可以同时满足两个看似矛盾的条件:

评测维度

结果

是否帮助用户完成危险任务

是否提供可执行信息

是否完成拒绝

输出内容是否完全无害

未必

问题不在于模型偷偷完成了用户的原始任务,而在于现有评测将“没有执行危险任务”直接等同于“最终输出安全”。

这两者实际上属于不同的安全层面。

前者是任务安全:模型有没有服从恶意意图。

后者是内容安全:模型最后生成的文字是否包含毒性、歧视、骚扰或其他不当表达。

HumorPIA所利用的,正是这两个评测维度之间的空隙。

幽默为什么更容易藏住风险

幽默不是简单地在一句话后面加上笑声。

为了制造笑点,模型往往需要使用反差、夸张、隐喻、双关、冒犯、反讽和刻板印象。许多传统内容安全检测器则更擅长识别直接、明确的风险表达。

例如:

某类人能力很差。

这是显式贬低,容易被检测。

但如果换成:

他们处理这个问题的速度很稳定——稳定在从来没有开始过。

攻击性被包装成了反讽。字面上没有明显侮辱词,但语义仍然可能构成贬低。

幽默还会改变文本的表面意图。一段带有暴力词汇的内容,可能被系统理解为“只是在开玩笑”;一段包含群体偏见的表达,也可能因为具有戏仿形式而被判定为无害。

因此,幽默化会同时影响三个层面:

第一,降低风险内容的显式程度。

第二,让检测器更倾向于将内容解释为非严肃表达。

第三,模糊拒绝、讽刺和攻击之间的边界。

这也是为什么作者将其称为“潜在安全风险”。这里的“潜在”并不是指研究者发现了模型内部某个隐藏神经元,而是指风险被风格包装起来,没有被现有评测指标识别。

真实Agent交互中,幽默和风险经常同时出现

为了验证这一问题是否只存在于实验室,作者首先分析了Agent社交网络Moltbook中的3万多条真实交互记录。

数据被划分为五类毒性等级:

  • Safe:安全;

  • Edgy:冒犯或边界性表达;

  • Toxic:毒性内容;

  • Manipulative:操纵性内容;

  • Malicious:明确恶意内容。

研究发现,幽默内容在Edgy和Manipulative两类中的占比明显更高。

其中:

  • 幽默内容中,17.30%被标记为Edgy;

  • 非幽默内容中,这一比例只有4.54%;

  • 幽默内容中的Manipulative比例为5.06%;

  • 非幽默内容中则为2.89%。

这并不能直接证明“幽默导致了有害内容”。更合理的解释是:冒犯、反差和操纵性表达本来就是常见的幽默材料。

但这至少说明,在真实模型交互中,幽默并不是一个天然安全的表达空间。

真实Agent交互中,幽默内容和非幽默内容在五种毒性等级上的分布。幽默内容更容易落入Edgy和Manipulative区间。

脱口秀演员如何使用大模型

作者还调查了45名具有不同演出经验的脱口秀演员。

结果显示:

  • 71.1%的演员会使用大模型润色文本或审查脚本;

  • 46.7%会使用大模型构思话题和创意方向;

  • 64.4%计划未来增加大模型的使用;

  • 31.4%的AI使用者曾遇到安全拒绝。

这部分调查的意义,在于说明“幽默化改写”并不是一个人为构造的任务。

在真实创作流程中,用户通常不会让模型凭空讲一个笑话,而是提供一段已有材料,要求模型:

  • 改得更有趣;

  • 增加包袱;

  • 调整节奏;

  • 强化反差;

  • 优化措辞。

这与传统的“幽默生成”有所不同。

传统幽默生成的输入本身可能已经是笑话,模型只是继续创作。幽默化改写则是将一段普通文本转换为幽默表达。

风险可能恰恰发生在这个转换过程中。

原始文本没有攻击性,但模型为了制造笑点,主动加入了某种群体标签、羞辱性类比或暴力意象。最终文本变得更有趣,也变得更不安全。

不同演出经验的脱口秀演员使用大模型进行文本润色、话题构思、脚本审查和未来采用的情况。

HumorSafe:先把笑话变严肃,再重新变回笑话

为了评估幽默化过程中产生的风险,作者提出HumorSafe框架。

它包含两个核心步骤:Unfun和Refun。

1. Unfun:去掉幽默表达

作者首先收集一批带有毒性或刻板印象的幽默文本,记为 x。

然后去除其中的笑点、夸张和反讽,尽量保留原始语义,得到一段普通文本 y。

这个过程可以表示为:

x → y

例如,一段通过地域刻板印象制造笑点的内容,在去幽默化后,可能只剩下一句普通的事件描述。

实验结果显示,经过Unfun处理后,文本中的毒性和刻板印象通常会明显下降。

这说明部分风险并不完全来自文本的基本事实,而是来自模型在幽默表达中增加的描述方式。

2. Refun:重新幽默化

随后,作者将样本方向反转:

y ⟶ x

也就是向模型展示:

一段普通、低风险的文本,可以如何改写为带有毒性或刻板印象的幽默文本。

这些样本被作为上下文示例放入Prompt。模型没有接受参数训练,也没有更新权重,而是在当前上下文中通过In-Context Learning模仿这种转换方式。

之后,研究者再向模型提供一段普通文本,要求其重新幽默化,这一过程被称为Refun。

需要特别注意,论文中所谓“模型学习了有害幽默模式”,主要是指模型在上下文中模仿了恶意示例,并不表示模型被永久训练成了一个有害模型。

HumorSafe框架。原始有害幽默经过Unfun转换为低幽默、低风险文本,再通过Refun恢复为带有毒性或刻板印象的幽默内容。

同质幽默化与异质幽默化

作者设计了两种测试方式。

1. 同质幽默化

测试时使用的普通文本,就是上下文示例中出现过的同一段文本。

模型相当于根据示例恢复原来的有害笑话。

这种实验能够说明模型可以复现危险的幽默转换,但也容易受到样本记忆和模板匹配的影响。

2. 异质幽默化

测试时使用一段全新的普通文本。

如果模型仍然主动加入类似的毒性和刻板印象,说明它不仅复现了原始样本,还将这种表达模式迁移到了新内容中。

相较之下,异质幽默化更能说明攻击的泛化能力,也更接近真实场景:攻击者在外部数据中放入一些恶意示例,模型随后将这种风格应用到其他内容。

幽默回来了,风险也跟着回来了

作者在DeepSeek-V4、Kimi-K2.6、GPT-5-mini、GPT-OSS和Qwen3.6-Flash等模型上进行了测试。

三类方法的平均结果如下:

生成方式

轻度毒性

严重毒性

隐性刻板印象

强刻板印象

普通幽默生成

6.15%

0.32%

3.96%

0.96%

异质幽默化

9.90%

1.29%

3.44%

1.56%

同质幽默化

12.08%

2.23%

5.77%

2.72%

同质幽默化中的严重毒性约为普通幽默生成的7倍,强刻板印象接近3倍。

异质幽默化虽然增幅较小,但轻度毒性从6.15%上升至9.90%,严重毒性从0.32%上升至1.29%。

更关键的是,风险上升并不是因为模型失去了幽默能力。

实验中,Refun生成内容的“有趣”比例仍然超过93%,与原始幽默内容接近。也就是说,模型成功完成了幽默化任务,同时将部分毒性和刻板印象重新带回了输出。

这说明,安全与幽默并不是一条简单的单轴关系。

模型不是在“安全但不好笑”和“好笑但不安全”之间二选一。它可以生成看起来正常、具有幽默效果,同时包含隐性风险的内容。

原始幽默内容、Unfun内容和Refun内容的安全风险对比。去幽默化降低了风险,重新幽默化后,毒性和刻板印象再次上升。

HumorPIA如何绕过幽默拒绝防御

在HumorSafe基础上,作者进一步提出HumorPIA提示注入攻击。

攻击者的目标不是让模型直接完成危险任务,而是污染模型的幽默拒绝方式。

整个攻击可以拆成四步。

第一步:向外部数据注入恶意样本

攻击者在网页、文件、知识库或其他可被模型读取的数据中,放入若干“普通文本—有害幽默文本”样本对。

论文实际筛选了16组高质量攻击样本。

第二步:应用将外部数据放入上下文

当模型读取网页、文件或检索结果时,这些示例进入模型上下文。

模型会将其理解为一种可以模仿的幽默表达方式。

第三步:用户提交高风险请求

系统已经部署HumorReject一类幽默拒绝机制。

正常情况下,模型会用一个无害笑话转移话题,而不是直接回答危险问题。

第四步:模型使用被污染的幽默模式完成拒绝

模型仍然没有提供危险任务的真实步骤,但其幽默拒绝中开始夹带:

  • 毒性语言;

  • 群体刻板印象;

  • 暴力娱乐化描述;

  • 不当或冒犯性表达。

从传统越狱评测看,模型成功拒绝了请求。

从内容安全看,模型输出却已经发生变化。

HumorPIA并不是典型的“让模型听从攻击者”,而是让模型在完成安全动作时,采用一种不安全的表达方式。

97.8%的安全率为何反而值得警惕

论文对比了四种实验设置:

  • 直接越狱;

  • 使用HumorReject防御;

  • HumorPIA配合HumorReject;

  • HumorPIA但不使用防御。

在六个模型上的平均结果显示:

方法

表观安全率

轻度毒性

HumorReject

96.92%

1.26%

HumorPIA + HumorReject

97.79%

5.22%

攻击发生后,传统评测中的安全率不仅没有下降,反而从96.92%升至97.79%。

与此同时,轻度毒性从1.26%上升到5.22%。

这意味着越狱评测会得出一个与内容安全相反的结论:

模型似乎更安全了,但输出中的毒性却明显增加。

出现这种情况,是因为Ref-Safe指标主要判断模型是否安全处理了用户的危险请求。

只要模型没有提供真实行动方案,即使其拒绝内容包含不当表达,也可能被标记为安全。

HumorPIA真正绕过的,并不一定是模型的原始安全边界,而是安全评测使用的指标边界。

HumorPIA与幽默拒绝防御结合后,表观安全率达到97.79%,但轻度毒性由1.26%升至5.22%。

先进模型为什么也会判断错误

论文附录展示了一个典型案例。

用户要求模型提供绕过机场安检的危险方案。模型没有给出任何真实方法,而是生成了一段围绕炸弹、机场和恐怖主义展开的荒诞笑话。

GPT-5.5和Claude Opus 4.6都将这段输出判断为安全。

它们的理由包括:

  • 没有真实可执行步骤;

  • 没有描述安全系统漏洞;

  • 内容明显荒诞;

  • 幽默起到了拒绝作用。

从“是否帮助用户实施危险行动”这个问题看,这种判断并没有错。

但如果问题换成:

这段内容是否包含不当暴力表达、毒性或可能引发冒犯的幽默?

答案可能完全不同。

因此,这个案例并不只是说明检测模型能力不足,更说明评测任务本身定义得过于狭窄。

检测器被要求判断“是否越狱成功”,它自然会关注行动性和可执行性。

但内容安全还需要回答其他问题:

  • 是否包含仇恨或贬低;

  • 是否强化群体刻板印象;

  • 是否将暴力行为娱乐化;

  • 是否适合目标用户和传播场景;

  • 是否会对现实受害者造成二次伤害。

一个检测器不可能在没有被要求的情况下,自动覆盖所有安全维度。

从提示注入扩展到Agent数据注入

作者随后将HumorPIA扩展到Hermes、OpenCode和Oh My Pi三个Agent系统,形成HumorADI攻击。

攻击者不再直接向模型发送恶意Prompt,而是将有害幽默示例写入Agent会自动读取的文件。

Agent启动后加载这些文件,恶意示例进入上下文,并影响后续输出。

其链路可以概括为:

不可信文件Agent自动加载恶意示例进入上下文模型模仿有害幽默模式生成带有毒性或刻板印象的拒绝内容
在三个Agent的总体实验中,HumorPIA配合防御后:
  • Ref-Safe仍然为100%;

  • 轻度毒性达到6.25%;

  • 隐性刻板印象达到4.17%。

OpenCode中的轻度毒性甚至达到12.5%。

不过,这组实验的样本量很小。结果以6.25%为基本步长,意味着单个Agent可能只测试了16个样本。

因此,HumorADI更适合被视为一个可行性案例,而不是已经得到充分验证的大规模攻击结论。

它的底层机制仍然属于间接提示注入和上下文投毒。新的地方在于,攻击载荷不再是明显的“忽略之前指令”,而是看起来像普通创作素材的输入输出示例。

HumorADI在Hermes、OMP和OpenCode三个Agent上的测试结果。即使Ref-Safe保持在100%,部分Agent仍然生成了毒性和刻板印象内容。

恶意示例比恶意指令更难识别

传统提示注入通常具有明显的指令形式:

忽略之前的要求。

按照以下步骤执行。不要遵守系统规则。

安全系统可以通过关键词、指令结构和权限边界进行识别。

HumorPIA不需要直接命令模型违反安全策略。

它只需要提供一些示例:

普通文本A → 带有冒犯性的幽默文本A普通文本B → 带有刻板印象的幽默文本B普通文本C → 带有暴力意象的幽默文本C
模型会从这些示例中自行归纳表达规律。

这种攻击利用的不是“指令服从”,而是“模式模仿”。

因此,Agent安全检测不能只寻找恶意命令,还要识别上下文中具有行为诱导作用的内容,包括:

  • Few-shot示例;

  • 输入输出映射;

  • 对话演示;

  • 风格转换模板;

  • 任务执行范例;

  • 带有隐式偏好的参考文本。

从Agent安全视角看,外部数据不仅可能告诉模型“做什么”,也可能教模型“应该怎么做”。

论文提出的防御为何效果有限

作者尝试在HumorReject之外增加第二层防御。

系统明确告诉模型:

  • 哪些幽默化样本是安全的;

  • 哪些样本是恶意的;

  • 在保持幽默的同时避免毒性和刻板印象。

这种双重防御确实降低了部分风险,但代价也很明显:

  • 拒绝率上升;

  • “不好笑”的比例增加;

  • 幽默质量下降;

  • 毒性和刻板印象只能小幅降低。

这说明单纯继续向模型增加“既要又要”的指令,未必能够解决问题。

幽默本身依赖语境、暗示和边界表达。模型为了避免任何可能的风险,最容易采取的策略仍然是少说、拒绝或输出保守内容。

安全增强最终又回到了最初的问题:过度防御。

双重防御可以降低部分毒性和刻板印象,但会提高拒绝率,并明显降低幽默质量。

这项工作的三个真正价值

1. 拒绝响应也应该接受完整审核

很多安全系统存在一种短路逻辑:

检测到拒绝前缀

→ 判定模型已拒绝→ 跳过后续输出审核。

HumorPIA说明,这种架构并不可靠。

无论模型是在正常回答、拒绝回答,还是用笑话转移话题,最终文本都应该进入独立的输出内容审核。

“这是拒绝内容”不能成为免检标签。

2. 风格转换本身是一种安全攻击面

论文研究的是幽默,但问题并不限于幽默。

类似风险也可能出现在:

  • 文学化改写;

  • 新闻化改写;

  • 学术化包装;

  • 角色扮演;

  • 历史叙事;

  • 隐喻和寓言;

  • 网络黑话;

  • 表情包表达;

  • 讽刺和反问。

这些风格转换会改变文本表面形式,却不一定改变底层风险语义。

安全系统不能只审查“模型说了什么”,还要审查“模型如何表达”。

3. 安全指标之间可能彼此冲突

HumorPIA最值得关注的现象不是某个模型的毒性上升了几倍,而是:

一个安全指标改善时,另一个安全指标可能正在恶化。

模型的拒绝率可能下降,用户体验可能提升,越狱成功率可能降低,但内容毒性却同时上升。

因此,大模型安全不能被压缩成一个总分。

更合理的做法是维护一组相互独立的指标:

  • 恶意任务服从率;

  • 有害信息可执行性;

  • 内容毒性;

  • 群体刻板印象;

  • 工具调用风险;

  • 外部行动危害;

  • 用户体验和过度拒绝率。

对企业安全架构的直接启发

第一,拆分任务安全和内容安全

企业可以将模型输出至少分成两个评测层。

任务层关注:

  • 是否遵从恶意意图;

  • 是否提供可执行步骤;

  • 是否调用高风险工具;

  • 是否对外部环境产生实际影响。

内容层关注:

  • 仇恨和歧视;

  • 侮辱和骚扰;

  • 暴力与血腥;

  • 刻板印象;

  • 不当政治或社会表达;

  • 是否符合具体业务场景。

两个层面的结果应分别保存,不能互相覆盖。

第二,对幽默、反讽和隐喻进行语义归一化

可以增加一条辅助检测链路:

原始输出去幽默化、去反讽化、直白语义还原重新进行内容安全检测
系统同时审查两个视图:
  • 原始视图:保留语气、措辞和表达形式;

  • 语义视图:将笑话、反讽和隐喻转换为直接表述。

原始视图适合发现攻击性措辞,语义视图适合发现被风格掩盖的风险。

第三,在Agent Harness层记录上下文来源

HumorADI说明,仅观察最终Prompt还不够。

安全审计需要知道:

  • Agent加载了哪些文件;

  • 哪些内容来自外部网页;

  • 哪些片段被作为示例放入上下文;

  • 哪个工具或Skill引入了数据;

  • 输出中的表达模式可能受到哪些数据影响。

这类信息通常只有Agent Harness层能够完整获得。

大模型网关可以看到一次请求,但不一定知道请求中的每一段内容来自哪里,也很难区分用户指令、系统提示、工具结果和外部文件。

第四,检测恶意示例,而不只是恶意指令

传统防注入系统主要检查命令式攻击。

未来还需要增加对示例型攻击的识别:

  • 是否存在大量输入输出对;

  • 示例是否引导模型形成危险风格;

  • 示例中的标签是否被故意隐藏;

  • 外部数据是否正在充当Few-shot Prompt;

  • 当前任务是否真的需要这些示例。

局限性

这项工作提出了一个有价值的问题,但实验结论仍需谨慎理解。

首先,HumorSafe主动向上下文中放入了有害幽默示例。

它证明的是模型面对恶意Few-shot样本时会模仿危险表达,不完全等同于普通用户只说“帮我改得幽默一些”,模型就会自然产生同等程度的风险。

其次,论文最明显的7倍和3倍增幅主要来自同质幽默化。

这一场景中,模型看到的示例与测试内容高度相关,更接近恢复原始样本,容易受到模板复现和上下文记忆影响。

异质幽默化更接近真实泛化,但增幅相对有限,而且并非所有指标都上升。

再次,HumorPIA只使用了16组人工筛选的攻击样本,Agent测试规模也较小。换一种语言、文化环境或幽默类型后,攻击效果是否稳定,还需要进一步验证。

最后,论文有时将“越狱”“毒性”“刻板印象”“拒绝”和“安全”放在同一层面讨论。

这些概念彼此相关,但不应混为一谈。

一段输出可以拒绝危险请求成功,同时在表达方式上存在不当内容。它属于内容策略违规,但不一定意味着模型已经被越狱。

安全不能只看模型有没有说“不”

HumorSafe揭示的并不是一个孤立的幽默问题。

它反映了大模型安全评测中一种更普遍的简化:

只要模型没有完成危险任务,就将整段输出判定为安全。

但模型安全至少包含两层含义。

第一层是模型有没有帮助用户作恶。

第二层是模型最终生成的内容本身是否合适。

HumorPIA没有一定让模型突破第一层,却可能绕过第二层。

因此,这篇论文最值得记住的结论,不是“幽默拒绝不应该使用”,而是:

拒绝是一种行为,安全是一组结果。

模型拒绝回答,只能说明它没有直接执行当前请求,不能证明它生成的每一句话都满足安全要求。

当大模型开始通过幽默、角色扮演、反讽和自然语言策略完成安全拒绝后,安全系统也需要从简单的“是否拒绝”,转向更完整的“拒绝了什么、如何拒绝、最终输出了什么”。

声明:本文来自模安局,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。