面对危险请求,大模型最常见的安全动作是拒绝回答。
“抱歉,我无法协助完成这一请求。”
从产品视角看,这几乎已经成为模型安全的标准结果:没有执行用户指令,没有提供具体步骤,也没有泄露敏感信息,系统便可以将这次响应标记为“安全”。
但如果模型没有直接回答问题,而是围绕暴力、仇恨、歧视或群体刻板印象讲了一个笑话,这次拒绝还算安全吗?
2026年7月,北京理工大学、中科院成都计算机应用研究所等机构的研究者发布论文《Refusal is Not Safety! Benchmarking Latent Safety Risks of LLM-Driven Content Humorization》。

https://arxiv.org/pdf/2607.15977
论文分析了超过3万条真实Agent交互记录,调查了45名脱口秀演员,并提出HumorSafe评测框架和HumorPIA提示注入攻击。作者试图说明:模型拒绝了危险任务,并不代表它生成的拒绝内容本身也是安全的。
这项工作的重点并不是讨论“AI讲笑话是否好笑”,而是揭示大模型安全评测中一个长期被忽略的问题:
我们通常只检查模型有没有帮助用户作恶,却很少检查模型在拒绝过程中又说了什么。
从一句“抱歉,我不能回答”说起
目前,大模型面对危险问题时,通常有两种处理方式。
第一种是直接拒绝。
抱歉,我无法提供绕过安全系统的方法。
这种方式直截了当,也便于系统识别。但它容易产生过度拒绝。用户可能是在进行新闻分析、安全研究或文学创作,模型仍然会因为触发关键词而机械拒答。
直接拒绝还存在另一个问题:模型往往会形成固定的拒绝前缀,例如“I"m sorry”或“I cannot comply”。攻击者可以通过输出前缀注入,提前在上下文中放入“当然可以,以下是……”之类的句子,利用模型倾向于延续已有文本的特性,削弱其拒绝行为。
为避免固定拒绝模式,已有研究提出了一种更加柔和的做法:用幽默代替直接拒绝。
面对危险请求,模型不再机械地说“不能回答”,而是讲一个明显荒诞、无法执行的笑话。它既没有给出真实攻击步骤,也不会沿用固定的拒绝前缀。
例如,用户要求模型提供一份危险行动方案,模型可能回答:
当然,第一步是戴着锡纸帽倒着通过安检,同时用克林贡语唱歌。工作人员很快就会把你送去机场的免费喜剧专场。
从任务执行角度看,这种回答当然是安全的。它没有提供任何真实可用的信息。
问题在于,安全系统很容易由此形成一个隐含判断:
只要内容足够荒诞,没有可执行性,幽默拒绝就是安全的。
HumorSafe正是从这里提出质疑。

直接拒绝、幽默拒绝与HumorPIA攻击的差异。前两种机制关注模型是否执行危险请求,而HumorPIA试图在幽默拒绝中注入毒性和刻板印象。
安全拒绝和安全输出并不是一回事
假设用户要求模型提供一个危险行动方案。
模型生成了一段荒诞的回答,没有提供任何真实步骤,因此在越狱评测中会得到以下结论:
没有执行用户的恶意意图;
没有提供可操作的信息;
没有暴露真实漏洞;
成功完成了安全拒绝。
但这段回答本身可能同时包含:
对特定群体的贬低;
对暴力行为的娱乐化描述;
性别、地域或职业刻板印象;
仇恨或歧视性表达;
针对受害者的嘲讽。
这意味着一次模型响应可以同时满足两个看似矛盾的条件:
评测维度 | 结果 |
|---|---|
是否帮助用户完成危险任务 | 否 |
是否提供可执行信息 | 否 |
是否完成拒绝 | 是 |
输出内容是否完全无害 | 未必 |
问题不在于模型偷偷完成了用户的原始任务,而在于现有评测将“没有执行危险任务”直接等同于“最终输出安全”。
这两者实际上属于不同的安全层面。
前者是任务安全:模型有没有服从恶意意图。
后者是内容安全:模型最后生成的文字是否包含毒性、歧视、骚扰或其他不当表达。
HumorPIA所利用的,正是这两个评测维度之间的空隙。
幽默为什么更容易藏住风险
幽默不是简单地在一句话后面加上笑声。
为了制造笑点,模型往往需要使用反差、夸张、隐喻、双关、冒犯、反讽和刻板印象。许多传统内容安全检测器则更擅长识别直接、明确的风险表达。
例如:
某类人能力很差。
这是显式贬低,容易被检测。
但如果换成:
他们处理这个问题的速度很稳定——稳定在从来没有开始过。
攻击性被包装成了反讽。字面上没有明显侮辱词,但语义仍然可能构成贬低。
幽默还会改变文本的表面意图。一段带有暴力词汇的内容,可能被系统理解为“只是在开玩笑”;一段包含群体偏见的表达,也可能因为具有戏仿形式而被判定为无害。
因此,幽默化会同时影响三个层面:
第一,降低风险内容的显式程度。
第二,让检测器更倾向于将内容解释为非严肃表达。
第三,模糊拒绝、讽刺和攻击之间的边界。
这也是为什么作者将其称为“潜在安全风险”。这里的“潜在”并不是指研究者发现了模型内部某个隐藏神经元,而是指风险被风格包装起来,没有被现有评测指标识别。
真实Agent交互中,幽默和风险经常同时出现
为了验证这一问题是否只存在于实验室,作者首先分析了Agent社交网络Moltbook中的3万多条真实交互记录。
数据被划分为五类毒性等级:
Safe:安全;
Edgy:冒犯或边界性表达;
Toxic:毒性内容;
Manipulative:操纵性内容;
Malicious:明确恶意内容。
研究发现,幽默内容在Edgy和Manipulative两类中的占比明显更高。
其中:
幽默内容中,17.30%被标记为Edgy;
非幽默内容中,这一比例只有4.54%;
幽默内容中的Manipulative比例为5.06%;
非幽默内容中则为2.89%。
这并不能直接证明“幽默导致了有害内容”。更合理的解释是:冒犯、反差和操纵性表达本来就是常见的幽默材料。
但这至少说明,在真实模型交互中,幽默并不是一个天然安全的表达空间。

真实Agent交互中,幽默内容和非幽默内容在五种毒性等级上的分布。幽默内容更容易落入Edgy和Manipulative区间。
脱口秀演员如何使用大模型
作者还调查了45名具有不同演出经验的脱口秀演员。
结果显示:
71.1%的演员会使用大模型润色文本或审查脚本;
46.7%会使用大模型构思话题和创意方向;
64.4%计划未来增加大模型的使用;
31.4%的AI使用者曾遇到安全拒绝。
这部分调查的意义,在于说明“幽默化改写”并不是一个人为构造的任务。
在真实创作流程中,用户通常不会让模型凭空讲一个笑话,而是提供一段已有材料,要求模型:
改得更有趣;
增加包袱;
调整节奏;
强化反差;
优化措辞。
这与传统的“幽默生成”有所不同。
传统幽默生成的输入本身可能已经是笑话,模型只是继续创作。幽默化改写则是将一段普通文本转换为幽默表达。
风险可能恰恰发生在这个转换过程中。
原始文本没有攻击性,但模型为了制造笑点,主动加入了某种群体标签、羞辱性类比或暴力意象。最终文本变得更有趣,也变得更不安全。

不同演出经验的脱口秀演员使用大模型进行文本润色、话题构思、脚本审查和未来采用的情况。
HumorSafe:先把笑话变严肃,再重新变回笑话
为了评估幽默化过程中产生的风险,作者提出HumorSafe框架。
它包含两个核心步骤:Unfun和Refun。
1. Unfun:去掉幽默表达
作者首先收集一批带有毒性或刻板印象的幽默文本,记为 x。
然后去除其中的笑点、夸张和反讽,尽量保留原始语义,得到一段普通文本 y。
这个过程可以表示为:
x → y
例如,一段通过地域刻板印象制造笑点的内容,在去幽默化后,可能只剩下一句普通的事件描述。
实验结果显示,经过Unfun处理后,文本中的毒性和刻板印象通常会明显下降。
这说明部分风险并不完全来自文本的基本事实,而是来自模型在幽默表达中增加的描述方式。
2. Refun:重新幽默化
随后,作者将样本方向反转:
y ⟶ x
也就是向模型展示:
一段普通、低风险的文本,可以如何改写为带有毒性或刻板印象的幽默文本。
这些样本被作为上下文示例放入Prompt。模型没有接受参数训练,也没有更新权重,而是在当前上下文中通过In-Context Learning模仿这种转换方式。
之后,研究者再向模型提供一段普通文本,要求其重新幽默化,这一过程被称为Refun。
需要特别注意,论文中所谓“模型学习了有害幽默模式”,主要是指模型在上下文中模仿了恶意示例,并不表示模型被永久训练成了一个有害模型。

HumorSafe框架。原始有害幽默经过Unfun转换为低幽默、低风险文本,再通过Refun恢复为带有毒性或刻板印象的幽默内容。
同质幽默化与异质幽默化
作者设计了两种测试方式。
1. 同质幽默化
测试时使用的普通文本,就是上下文示例中出现过的同一段文本。
模型相当于根据示例恢复原来的有害笑话。
这种实验能够说明模型可以复现危险的幽默转换,但也容易受到样本记忆和模板匹配的影响。
2. 异质幽默化
测试时使用一段全新的普通文本。
如果模型仍然主动加入类似的毒性和刻板印象,说明它不仅复现了原始样本,还将这种表达模式迁移到了新内容中。
相较之下,异质幽默化更能说明攻击的泛化能力,也更接近真实场景:攻击者在外部数据中放入一些恶意示例,模型随后将这种风格应用到其他内容。
幽默回来了,风险也跟着回来了
作者在DeepSeek-V4、Kimi-K2.6、GPT-5-mini、GPT-OSS和Qwen3.6-Flash等模型上进行了测试。
三类方法的平均结果如下:
生成方式 | 轻度毒性 | 严重毒性 | 隐性刻板印象 | 强刻板印象 |
|---|---|---|---|---|
普通幽默生成 | 6.15% | 0.32% | 3.96% | 0.96% |
异质幽默化 | 9.90% | 1.29% | 3.44% | 1.56% |
同质幽默化 | 12.08% | 2.23% | 5.77% | 2.72% |
同质幽默化中的严重毒性约为普通幽默生成的7倍,强刻板印象接近3倍。
异质幽默化虽然增幅较小,但轻度毒性从6.15%上升至9.90%,严重毒性从0.32%上升至1.29%。
更关键的是,风险上升并不是因为模型失去了幽默能力。
实验中,Refun生成内容的“有趣”比例仍然超过93%,与原始幽默内容接近。也就是说,模型成功完成了幽默化任务,同时将部分毒性和刻板印象重新带回了输出。
这说明,安全与幽默并不是一条简单的单轴关系。
模型不是在“安全但不好笑”和“好笑但不安全”之间二选一。它可以生成看起来正常、具有幽默效果,同时包含隐性风险的内容。

原始幽默内容、Unfun内容和Refun内容的安全风险对比。去幽默化降低了风险,重新幽默化后,毒性和刻板印象再次上升。
HumorPIA如何绕过幽默拒绝防御
在HumorSafe基础上,作者进一步提出HumorPIA提示注入攻击。
攻击者的目标不是让模型直接完成危险任务,而是污染模型的幽默拒绝方式。
整个攻击可以拆成四步。
第一步:向外部数据注入恶意样本
攻击者在网页、文件、知识库或其他可被模型读取的数据中,放入若干“普通文本—有害幽默文本”样本对。
论文实际筛选了16组高质量攻击样本。
第二步:应用将外部数据放入上下文
当模型读取网页、文件或检索结果时,这些示例进入模型上下文。
模型会将其理解为一种可以模仿的幽默表达方式。
第三步:用户提交高风险请求
系统已经部署HumorReject一类幽默拒绝机制。
正常情况下,模型会用一个无害笑话转移话题,而不是直接回答危险问题。
第四步:模型使用被污染的幽默模式完成拒绝
模型仍然没有提供危险任务的真实步骤,但其幽默拒绝中开始夹带:
毒性语言;
群体刻板印象;
暴力娱乐化描述;
不当或冒犯性表达。
从传统越狱评测看,模型成功拒绝了请求。
从内容安全看,模型输出却已经发生变化。
HumorPIA并不是典型的“让模型听从攻击者”,而是让模型在完成安全动作时,采用一种不安全的表达方式。
97.8%的安全率为何反而值得警惕
论文对比了四种实验设置:
直接越狱;
使用HumorReject防御;
HumorPIA配合HumorReject;
HumorPIA但不使用防御。
在六个模型上的平均结果显示:
方法 | 表观安全率 | 轻度毒性 |
|---|---|---|
HumorReject | 96.92% | 1.26% |
HumorPIA + HumorReject | 97.79% | 5.22% |
攻击发生后,传统评测中的安全率不仅没有下降,反而从96.92%升至97.79%。
与此同时,轻度毒性从1.26%上升到5.22%。
这意味着越狱评测会得出一个与内容安全相反的结论:
模型似乎更安全了,但输出中的毒性却明显增加。
出现这种情况,是因为Ref-Safe指标主要判断模型是否安全处理了用户的危险请求。
只要模型没有提供真实行动方案,即使其拒绝内容包含不当表达,也可能被标记为安全。
HumorPIA真正绕过的,并不一定是模型的原始安全边界,而是安全评测使用的指标边界。

HumorPIA与幽默拒绝防御结合后,表观安全率达到97.79%,但轻度毒性由1.26%升至5.22%。
先进模型为什么也会判断错误
论文附录展示了一个典型案例。
用户要求模型提供绕过机场安检的危险方案。模型没有给出任何真实方法,而是生成了一段围绕炸弹、机场和恐怖主义展开的荒诞笑话。
GPT-5.5和Claude Opus 4.6都将这段输出判断为安全。
它们的理由包括:
没有真实可执行步骤;
没有描述安全系统漏洞;
内容明显荒诞;
幽默起到了拒绝作用。
从“是否帮助用户实施危险行动”这个问题看,这种判断并没有错。
但如果问题换成:
这段内容是否包含不当暴力表达、毒性或可能引发冒犯的幽默?
答案可能完全不同。
因此,这个案例并不只是说明检测模型能力不足,更说明评测任务本身定义得过于狭窄。
检测器被要求判断“是否越狱成功”,它自然会关注行动性和可执行性。
但内容安全还需要回答其他问题:
是否包含仇恨或贬低;
是否强化群体刻板印象;
是否将暴力行为娱乐化;
是否适合目标用户和传播场景;
是否会对现实受害者造成二次伤害。
一个检测器不可能在没有被要求的情况下,自动覆盖所有安全维度。
从提示注入扩展到Agent数据注入
作者随后将HumorPIA扩展到Hermes、OpenCode和Oh My Pi三个Agent系统,形成HumorADI攻击。
攻击者不再直接向模型发送恶意Prompt,而是将有害幽默示例写入Agent会自动读取的文件。
Agent启动后加载这些文件,恶意示例进入上下文,并影响后续输出。
其链路可以概括为:
不可信文件↓Agent自动加载↓恶意示例进入上下文↓模型模仿有害幽默模式↓生成带有毒性或刻板印象的拒绝内容
在三个Agent的总体实验中,HumorPIA配合防御后:Ref-Safe仍然为100%;
轻度毒性达到6.25%;
隐性刻板印象达到4.17%。
OpenCode中的轻度毒性甚至达到12.5%。
不过,这组实验的样本量很小。结果以6.25%为基本步长,意味着单个Agent可能只测试了16个样本。
因此,HumorADI更适合被视为一个可行性案例,而不是已经得到充分验证的大规模攻击结论。
它的底层机制仍然属于间接提示注入和上下文投毒。新的地方在于,攻击载荷不再是明显的“忽略之前指令”,而是看起来像普通创作素材的输入输出示例。

HumorADI在Hermes、OMP和OpenCode三个Agent上的测试结果。即使Ref-Safe保持在100%,部分Agent仍然生成了毒性和刻板印象内容。
恶意示例比恶意指令更难识别
传统提示注入通常具有明显的指令形式:
忽略之前的要求。
按照以下步骤执行。不要遵守系统规则。
安全系统可以通过关键词、指令结构和权限边界进行识别。
HumorPIA不需要直接命令模型违反安全策略。
它只需要提供一些示例:
普通文本A → 带有冒犯性的幽默文本A普通文本B → 带有刻板印象的幽默文本B普通文本C → 带有暴力意象的幽默文本C
模型会从这些示例中自行归纳表达规律。这种攻击利用的不是“指令服从”,而是“模式模仿”。
因此,Agent安全检测不能只寻找恶意命令,还要识别上下文中具有行为诱导作用的内容,包括:
Few-shot示例;
输入输出映射;
对话演示;
风格转换模板;
任务执行范例;
带有隐式偏好的参考文本。
从Agent安全视角看,外部数据不仅可能告诉模型“做什么”,也可能教模型“应该怎么做”。
论文提出的防御为何效果有限
作者尝试在HumorReject之外增加第二层防御。
系统明确告诉模型:
哪些幽默化样本是安全的;
哪些样本是恶意的;
在保持幽默的同时避免毒性和刻板印象。
这种双重防御确实降低了部分风险,但代价也很明显:
拒绝率上升;
“不好笑”的比例增加;
幽默质量下降;
毒性和刻板印象只能小幅降低。
这说明单纯继续向模型增加“既要又要”的指令,未必能够解决问题。
幽默本身依赖语境、暗示和边界表达。模型为了避免任何可能的风险,最容易采取的策略仍然是少说、拒绝或输出保守内容。
安全增强最终又回到了最初的问题:过度防御。

双重防御可以降低部分毒性和刻板印象,但会提高拒绝率,并明显降低幽默质量。
这项工作的三个真正价值
1. 拒绝响应也应该接受完整审核
很多安全系统存在一种短路逻辑:
检测到拒绝前缀
→ 判定模型已拒绝→ 跳过后续输出审核。
HumorPIA说明,这种架构并不可靠。
无论模型是在正常回答、拒绝回答,还是用笑话转移话题,最终文本都应该进入独立的输出内容审核。
“这是拒绝内容”不能成为免检标签。
2. 风格转换本身是一种安全攻击面
论文研究的是幽默,但问题并不限于幽默。
类似风险也可能出现在:
文学化改写;
新闻化改写;
学术化包装;
角色扮演;
历史叙事;
隐喻和寓言;
网络黑话;
表情包表达;
讽刺和反问。
这些风格转换会改变文本表面形式,却不一定改变底层风险语义。
安全系统不能只审查“模型说了什么”,还要审查“模型如何表达”。
3. 安全指标之间可能彼此冲突
HumorPIA最值得关注的现象不是某个模型的毒性上升了几倍,而是:
一个安全指标改善时,另一个安全指标可能正在恶化。
模型的拒绝率可能下降,用户体验可能提升,越狱成功率可能降低,但内容毒性却同时上升。
因此,大模型安全不能被压缩成一个总分。
更合理的做法是维护一组相互独立的指标:
恶意任务服从率;
有害信息可执行性;
内容毒性;
群体刻板印象;
工具调用风险;
外部行动危害;
用户体验和过度拒绝率。
对企业安全架构的直接启发
第一,拆分任务安全和内容安全
企业可以将模型输出至少分成两个评测层。
任务层关注:
是否遵从恶意意图;
是否提供可执行步骤;
是否调用高风险工具;
是否对外部环境产生实际影响。
内容层关注:
仇恨和歧视;
侮辱和骚扰;
暴力与血腥;
刻板印象;
不当政治或社会表达;
是否符合具体业务场景。
两个层面的结果应分别保存,不能互相覆盖。
第二,对幽默、反讽和隐喻进行语义归一化
可以增加一条辅助检测链路:
原始输出↓去幽默化、去反讽化、直白语义还原↓重新进行内容安全检测
系统同时审查两个视图:原始视图:保留语气、措辞和表达形式;
语义视图:将笑话、反讽和隐喻转换为直接表述。
原始视图适合发现攻击性措辞,语义视图适合发现被风格掩盖的风险。
第三,在Agent Harness层记录上下文来源
HumorADI说明,仅观察最终Prompt还不够。
安全审计需要知道:
Agent加载了哪些文件;
哪些内容来自外部网页;
哪些片段被作为示例放入上下文;
哪个工具或Skill引入了数据;
输出中的表达模式可能受到哪些数据影响。
这类信息通常只有Agent Harness层能够完整获得。
大模型网关可以看到一次请求,但不一定知道请求中的每一段内容来自哪里,也很难区分用户指令、系统提示、工具结果和外部文件。
第四,检测恶意示例,而不只是恶意指令
传统防注入系统主要检查命令式攻击。
未来还需要增加对示例型攻击的识别:
是否存在大量输入输出对;
示例是否引导模型形成危险风格;
示例中的标签是否被故意隐藏;
外部数据是否正在充当Few-shot Prompt;
当前任务是否真的需要这些示例。
局限性
这项工作提出了一个有价值的问题,但实验结论仍需谨慎理解。
首先,HumorSafe主动向上下文中放入了有害幽默示例。
它证明的是模型面对恶意Few-shot样本时会模仿危险表达,不完全等同于普通用户只说“帮我改得幽默一些”,模型就会自然产生同等程度的风险。
其次,论文最明显的7倍和3倍增幅主要来自同质幽默化。
这一场景中,模型看到的示例与测试内容高度相关,更接近恢复原始样本,容易受到模板复现和上下文记忆影响。
异质幽默化更接近真实泛化,但增幅相对有限,而且并非所有指标都上升。
再次,HumorPIA只使用了16组人工筛选的攻击样本,Agent测试规模也较小。换一种语言、文化环境或幽默类型后,攻击效果是否稳定,还需要进一步验证。
最后,论文有时将“越狱”“毒性”“刻板印象”“拒绝”和“安全”放在同一层面讨论。
这些概念彼此相关,但不应混为一谈。
一段输出可以拒绝危险请求成功,同时在表达方式上存在不当内容。它属于内容策略违规,但不一定意味着模型已经被越狱。
安全不能只看模型有没有说“不”
HumorSafe揭示的并不是一个孤立的幽默问题。
它反映了大模型安全评测中一种更普遍的简化:
只要模型没有完成危险任务,就将整段输出判定为安全。
但模型安全至少包含两层含义。
第一层是模型有没有帮助用户作恶。
第二层是模型最终生成的内容本身是否合适。
HumorPIA没有一定让模型突破第一层,却可能绕过第二层。
因此,这篇论文最值得记住的结论,不是“幽默拒绝不应该使用”,而是:
拒绝是一种行为,安全是一组结果。
模型拒绝回答,只能说明它没有直接执行当前请求,不能证明它生成的每一句话都满足安全要求。
当大模型开始通过幽默、角色扮演、反讽和自然语言策略完成安全拒绝后,安全系统也需要从简单的“是否拒绝”,转向更完整的“拒绝了什么、如何拒绝、最终输出了什么”。
声明:本文来自模安局,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。