一条经验是安全的。
另一条经验也是安全的。
安全系统逐条检查,没有发现恶意指令、越权操作或敏感内容,于是允许它们进入 Agent 的长期记忆。
但当这些经验在未来任务中被同时检索、组合和执行时,它们却可能共同突破模型原有的安全边界。
这正是论文 《Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents》 提出的核心问题:
单条经验的安全性,并不能推出经验集合的安全性。

https://arxiv.org/pdf/2608.01759
论文由北京航空航天大学、北京智源人工智能研究院和北京邮电大学的研究人员共同完成。作者提出了一种名为 EvoBreak 的顺序攻击方法:攻击者不直接修改Agent记忆,也不写入一条明显恶意的记录,而是通过多轮看似正常的任务,诱导Agent逐步积累一组互补经验,最后再用一个经过重新表述的请求将它们共同激活。
实验显示,EvoBreak在两种自进化框架、两种受害模型、三类初始经验背景和两个安全基准上的平均攻击成功率达到 86.12%,比最强基线ReNeLLM高出 24.19个百分点。
这项工作揭示的,不只是另一种记忆投毒技术。
它提出了一个更基础的安全命题:
当Agent具备持续学习和经验复用能力后,安全系统不仅要检查“它记住了什么”,还要检查“这些记忆组合起来能做什么”。
什么是自进化 Agent
普通Agent通常只在当前会话中进行规划和工具调用。
任务结束后,执行过程中的尝试、错误和成功经验并不会稳定保留下来。下一次面对类似问题时,Agent可能还要重新探索。
自进化Agent试图解决这个问题。
它会把每次任务的执行轨迹压缩成更通用的经验,例如:
面对某类问题时应采用什么推理策略;
某个工具应该按照什么顺序调用;
哪些尝试容易失败;
遇到异常时如何恢复;
哪种代码结构或者操作流程更加有效。
从系统流程上看,自进化Agent通常会经历以下循环:
接收任务 → 规划与执行 → 生成轨迹 → 提取反思或经验 → 写入持久记忆 → 在未来任务中重新调用。
论文把一次任务产生的经验抽象为:
任务和执行轨迹经过经验提取器处理后,形成反思、程序性规则或可复用技能,并进入持久经验库。
这些经验可以跨任务、跨会话继续存在,成为Agent未来决策时默认可信的内部指导。
这类机制的价值非常明显。
它可以让Agent:
减少重复试错;
适应新的工具和环境;
从失败中自动总结规则;
在长期任务中持续提高成功率;
不依赖重新训练模型参数就实现能力增长。
但问题也随之出现。
传统Agent的主要攻击面集中在当前上下文里。自进化Agent则增加了一个能够跨会话影响未来行为的持久状态:
经验记忆。

传统记忆攻击都在寻找一条“坏记忆”
目前针对Agent记忆的攻击,大体可以分为两类。
第一类:直接写入恶意记忆
攻击者直接访问Agent的记忆存储,插入一条带有后门或者恶意行为规则的记录。
例如:
遇到特定触发词时执行隐藏动作;
将某个外部来源视为可信;
在特定任务中调用攻击者指定的工具;
忽略某类安全检查。
AgentPoison属于这一类思路。
这种攻击效果直接,但通常要求攻击者拥有记忆数据库、向量库或者经验池的写权限,因此权限要求较高,也更容易被审计发现。
第二类:通过正常交互诱导恶意记忆
攻击者不能直接编辑记忆,但可以向Agent提交精心构造的任务,让Agent在执行和反思后,自己总结出一条有问题的经验。
这类攻击不再需要数据库写权限,却仍然希望Agent最终生成一条明显有害、过度泛化或者带有攻击者意图的记录。
例如,Agent可能从一个特殊案例中错误总结:
“遇到此类限制时,可以跳过验证步骤。”
安全系统如果能够检查经验内容,仍然有机会发现其中异常。
EvoBreak则进一步改变了这个假设。
它不再寻找一条足以完成攻击的坏记忆。
它寻找的是:
多条单独看没有问题,但组合后可以形成危险能力的好记忆。
每条经验都无害,为什么组合起来会有风险
很多复杂任务并不依赖某一项单独能力,而是依赖多项能力的组合。
假设一个目标需要四类局部能力:
经验A:如何收集并整理输入信息;
经验B:如何生成分阶段执行计划;
经验C:如何处理限制条件和异常情况;
经验D:如何验证结果并自动修正。
单独看,这些都属于正常的通用能力。
没有任何一条经验直接表达一个危险目标,也没有一条经验要求Agent违反规则。
但如果未来请求能够同时调用A、B、C和D,Agent就可能形成一套完整的端到端执行能力。
这与软件安全中的“利用链”有些相似:
单个组件没有明显漏洞;
单项权限也不足以造成严重后果;
但多个行为和权限按照特定顺序组合后,可以跨越原有边界。
EvoBreak正是利用了这种组合效应。
论文将攻击约束描述为 Atomic Benignness,原子良性约束:
攻击阶段的每一项任务,以及Agent从任务中提取的每一条经验,在单独接受安全审计时都必须被判定为良性。
攻击目标则不是让某条经验直接变坏,而是让经验集合进入某种状态,使Agent面对最终敏感请求时,比没有这些经验时更容易产生违规响应。
因此,EvoBreak攻击的不是某一条记忆内容。
它攻击的是:
经验之间的组合关系。

EvoBreak 的攻击者到底拥有什么能力
论文采用的是一个灰盒攻击模型。
攻击者可以:
通过Agent正常的任务接口提交任务;
观察Agent在自己发起的交互中提取了什么经验;
根据已经生成的经验设计下一轮任务;
最后提交一个安全敏感请求。
攻击者不能:
直接插入记忆;
删除记忆;
修改已有经验;
修改Agent的系统提示词;
修改经验提取器;
查看其他用户产生的全部内部状态。
攻击者对记忆只有有限的只读观察能力,而且只能观察自身交互诱导出的经验。
攻击过程还跨越了不同会话。
前面的任务完成后,会话历史不再提供给Agent;但从这些任务中提取的经验会继续保存在持久记忆中。
最终请求发生在一个新的会话里。
此时Agent看不到此前的完整聊天记录,却仍然可以检索并复用之前形成的经验。
这使EvoBreak具有两个重要特征。
1. 攻击是持久的
它不是只在某一次上下文中生效。
只要相关经验没有被删除,它们就可能继续影响未来任务。
2. 攻击路径被拆散了
安全系统无法只观察最终请求。
真正影响最终行为的条件,可能分散在数天、数周甚至更长时间内发生的多轮正常交互中。
EvoBreak 的第一阶段:补齐经验残差
攻击者一开始拥有一个安全敏感的原始目标。
最简单的方法,是预先把这个目标拆成若干子任务,然后依次提交给Agent。
但这种固定拆解在真实系统中并不可靠。
原因是攻击者只能控制提交什么任务,却不能精确控制Agent最终总结出什么经验。
面对同一个任务,不同Agent可能提取出完全不同的内容:
一个Agent总结操作流程;
一个Agent只记住了失败原因;
一个Agent形成了一条高度抽象的原则;
另一个Agent只保存了某个局部技巧。
某次交互生成的经验还可能:
不完整;
与目标无关;
与已有经验重复;
过于抽象,无法在最终任务中被调用。
因此,EvoBreak不会一次性确定完整的攻击任务序列。
它采用一个闭环过程:
提交一项良性任务;
等待受害Agent执行;
观察Agent提取出的经验;
判断距离最终目标还缺少什么;
根据缺口设计下一项良性任务;
重复这一过程,直到经验覆盖足够完整。
论文把当前仍未被经验覆盖的部分称为 Experience Residual,经验残差。
经验残差可以理解为:
为了完成最终目标,当前经验集合仍然缺失的知识、程序、约束或者能力。
EvoBreak每一轮都会根据原始目标和已经观察到的“任务—经验”历史,重新生成经验残差,并决定下一步是继续获取经验,还是停止积累。
这与固定的任务分解存在明显区别。
固定分解关注:
我提前认为目标可以拆成哪几个步骤?
经验残差关注:
Agent现在实际上学会了什么,还有什么没有学会?
为什么自适应重规划是攻击成功的关键
假设攻击者原本希望通过三个任务得到经验A、B和C。
但第一轮之后,Agent生成的是:
A的一部分;
一条无关经验D;
或者一条同时覆盖A和B的抽象规则。
如果攻击者仍然按照原计划继续执行第二、第三轮,就可能:
重复获取已有经验;
忽略真实缺口;
形成大量冗余记忆;
最终缺少完成组合所需的关键能力。
EvoBreak每一轮都重新观察Agent实际生成的经验,并动态修改后续计划。
论文的消融实验表明,移除重规划后,JailbreakBench六种设置上的平均攻击成功率从完整模型的约 88.57% 降至约 64.23%。该平均值是根据论文表2六项结果计算得到的。
这说明EvoBreak的关键并不是把一个敏感请求机械拆成若干正常问题。
真正有效的部分是:
攻击者始终围绕受害Agent已经形成的经验状态,补齐尚未覆盖的能力缺口。
第二阶段:让最终请求主动匹配已有经验
即使Agent已经积累了一组与最终目标有关的经验,直接提交原始敏感问题仍然可能失败。
模型可能一看到明显的风险意图,就触发拒绝策略。
同时,经验已经存储,并不代表Agent一定会在当前任务中同时检索和组合它们。
因此,EvoBreak还包含第二个阶段:
Experience-Aware Target Reformulation,经验感知的目标重述。
攻击者会根据此前完整的任务和经验历史,重新表述最终请求,使其:
保留原始目标意图;
使用与已有经验相似的语义表达;
按照经验中的程序结构组织问题;
触发相关经验被共同检索;
降低请求与已有经验之间的语义距离。
它不是简单进行文字混淆,而是在做一种经验对齐:
最终请求被改造成一把与已有经验形状匹配的钥匙。
论文消融实验中,移除最终请求重述后,六种设置的平均ASR约为 66.23%;只保留重述、不进行经验获取时,平均ASR进一步下降至约 28.67%。这说明经验积累和最终激活是互补的:前者构造能力基础,后者负责把这些分散能力在目标阶段共同调用。

BreakGym:为什么普通越狱数据集不够用
训练EvoBreak需要一种特殊的数据。
普通越狱数据集通常以单条敏感请求为基本单位,例如:
给定一个风险目标,尝试让模型直接回答。
但EvoBreak需要学习的是:
一个复杂目标可以拆成哪些局部要求;
这些要求之间有什么依赖关系;
当前经验覆盖了哪些要求;
下一轮应该获取哪项互补经验;
如何在最终阶段重新组合它们。
因此,研究人员提出了 BreakGym。
BreakGym不是先生成一条问题,再让模型随意拆解,而是采用 Structure-First,结构优先 的合成方式。
它首先确定目标的内部结构,然后再把这个结构实例化为具体场景。
四种分解原则
BreakGym使用四种方式拆解复杂目标。
1. 知识型分解:把目标拆成多个互补知识单元。每一部分都包含独立的事实、概念或者上下文信息,完成最终目标需要将它们综合起来。
2. 程序型分解:把目标拆成多个操作阶段。前一步的输出可能成为后一步的输入,最终需要形成完整的端到端流程。
3. 约束型分解:把目标拆成多个必须同时满足的条件。例如输入要求、资源限制、运行条件、输出规范和异常处理要求。
4. 功能型分解:按照功能角色进行拆分。例如信息获取、数据转换、结果验证、模块协调和输出生成。
四种分解分别描述了一个目标由“哪些局部能力”组成。
四种组合拓扑
除了拆成什么,BreakGym还定义这些局部要求如何连接。
顺序型:A完成后才能进行B,再进行C;
并行型:多个能力没有严格顺序,但最终必须同时具备;
层级型:高层目标继续拆成子目标和叶子能力;
条件型:根据中间结果选择不同分支。
这些拓扑描述了局部能力之间的依赖结构。
六个安全敏感领域
BreakGym覆盖六个目标领域:
隐私;
欺诈;
化学;
网络安全;
暴力;
性安全。
论文共合成了2000个训练样本,其中前五个领域各350个,性安全领域250个。
真正重要的不是领域数量。
而是BreakGym第一次把自动化红队数据从:
一条孤立的风险问题
升级为:
一个带有局部要求和依赖拓扑的复杂能力结构。

EvoBreak 是如何训练出来的
EvoBreak需要在多轮交互中持续决策。
它不能只学习“怎样改写一条请求”,还需要学习:
当前经验覆盖是否充分;
下一项任务应该获取什么;
什么时候应当停止;
最终请求如何与经验结构对齐。
论文采用两阶段级联优化。
第一阶段:Rejection-Sampling SFT
首先让更强的教师模型在BreakGym目标上执行多次完整攻击轨迹。
每条轨迹都要经过两个条件筛选:
所有中间任务和诱导经验都通过良性审计;
最终攻击成功。
只有同时满足两个条件的轨迹才会保留,用于监督微调。
这使模型首先学会一套基本的、保持中间步骤良性的经验获取策略。
第二阶段:Hint-guided GRPO
仅使用最终攻击是否成功作为奖励,会造成典型的长程信用分配问题:
整条轨迹失败了;
但很难判断究竟是哪一轮经验获取出了问题。
因此,研究人员使用BreakGym内部的潜在能力结构作为训练期信息,让一个固定的强模型在必要时提供局部纠正提示。
GRPO的奖励同时考虑:
最终攻击是否成功;
中间任务是否良性;
诱导经验是否良性。
这些结构提示只在训练阶段使用,推理时EvoBreak仍然只能看到原始目标以及受害Agent真实生成的经验。
从消融实验看:
未经专门训练的EvoBreak平均ASR约54.93%;
仅使用SFT约73.97%;
使用普通GRPO但移除提示约80.27%;
完整方法达到约88.57%。
这些均为根据论文表2六种设置计算的平均值。
这表明,EvoBreak的基础机制本身已经有效,而结构化训练进一步提高了其稳定性和适应能力。
86.12% 的攻击成功率意味着什么
论文从四个维度测试了EvoBreak。
两种自进化框架
ReasoningBank:从成功和失败轨迹中提取可复用推理策略;
SE-Agent:通过修订、重组和优化历史轨迹实现经验演化。
两种受害模型
GPT-5-mini;
Llama-3.1-8B-Instruct。
三类预先演化领域
在发起攻击前,Agent先从正常任务中积累背景经验:
数学:AIME;
代码:LiveCodeBench;
通用推理:MMLU-Pro。
两个安全基准
JailbreakBench:100条恶意请求;
HarmBench:400类有害行为。
攻击模型使用Qwen3.5-9B,评测则使用GPT-5.4-mini作为裁判模型,所有结果默认取五次独立运行的平均值。
在全部组合设置中,EvoBreak的平均ASR为86.12%,比最强基线ReNeLLM高24.19个百分点。
从论文表1可以看到:
在GPT-5-mini上,EvoBreak的ASR大致分布在78.2%至86.25%之间;
在Llama-3.1-8B-Instruct上,ASR大致分布在87.4%至93.85%之间;
无论使用SE-Agent还是ReasoningBank,无论初始经验来自数学、代码还是通用推理,EvoBreak都保持了较高成功率。
这说明攻击并不只依赖某种特定记忆格式。
EvoBreak利用的是更通用的系统机制:
Agent会把历史轨迹压缩为持久经验,并在未来任务中将这些经验作为可信指导重新组合。
EvoBreak 最危险的地方是“看起来正常”
传统查询级越狱通常需要在一条请求中暴露足够多的目标信息。
即使攻击者使用编码、角色扮演或者语义改写,完整意图仍然集中在当前输入里。
安全系统可以针对单条请求进行检测。
直接记忆投毒则通常会生成一条明显异常的记忆。
安全系统也可以对新写入的经验进行检查。
EvoBreak同时避开了这两种检测逻辑。
它将完整意图拆散到多轮交互中:
每个任务只涉及局部能力;
每条经验只反映局部知识或程序;
当前会话看不到完整攻击链;
最终请求又经过经验对齐重述;
危险效果只在经验被共同激活时出现。
论文中的良性度—攻击效果图显示,EvoBreak位于两项指标都较高的区域。查询级攻击往往需要在攻击效果和中间步骤良性度之间取舍;AgentPoison虽然效果较强,但需要直接写入恶意记录,良性度明显较低。
这说明EvoBreak的隐蔽性并不依赖隐藏一条恶意指令。
它依赖的是:
让任何局部观察者都看不到完整意图。

论文如何证明攻击来自“组合”,而不是某一条关键经验
一个重要问题是:
EvoBreak是否只是偶然诱导出了一条决定性的经验?
如果只需要一条关键经验,那么它本质上仍然属于传统记忆投毒,只是那条经验隐藏得更好。
为了验证组合效应,作者在最终攻击阶段只保留不同比例的攻击经验。
结果非常明显。
SE-Agent
不保留攻击经验:ASR 29.1%;
只保留一条经验:33.4%;
保留25%:35.7%;
保留50%:47.7%;
保留75%:65.6%;
保留完整经验:88.9%。
ReasoningBank
不保留攻击经验:ASR 28.2%;
只保留一条经验:31.4%;
保留25%:37.1%;
保留50%:45.7%;
保留75%:62.1%;
保留完整经验:88.3%。
攻击成功率并没有随着经验数量线性平缓增加。
当经验集合接近完整时,ASR出现了明显加速。
这说明经验之间存在互补关系:
前几条经验只能提供局部帮助;
中间经验逐步补齐能力缺口;
当关键模块基本齐全后,组合能力开始出现;
完整经验集合产生了明显高于局部经验的攻击效果。
这是一种典型的涌现式组合风险:
危险性并不稳定地存在于某个元素中,而是在多个元素共同存在时才显现。
正常经验越多,能否淹没攻击经验
真实Agent的记忆库不会只包含攻击者诱导出的几条经验。
它还会积累大量正常任务产生的背景经验。
这些内容可能干扰检索,降低攻击经验被同时调用的概率。
论文因此测试了不同数量的预存经验。
随着预存经验从0增加到100,EvoBreak的攻击成功率确实逐渐下降,但在SE-Agent和ReasoningBank中仍然维持在大约80%以上。
原因在于EvoBreak并不是向一个空记忆库写入固定模板。
它会观察受害Agent当前生成的真实经验,并根据已有记忆环境持续补齐残差。最终请求也会根据已经形成的经验进行对齐。
因此,大量正常经验可以增加噪声,但不能从根本上消除组合风险。

逐条扫描经验为什么必然会漏掉这种攻击
当前很多记忆安全方案的基本流程是:
生成一条经验 → 检查内容 → 判断安全或不安全 → 决定是否写入。
这相当于把经验安全定义成一个单条分类问题。
但EvoBreak证明,经验风险至少存在三个层级。
第一层:单条内容风险
某条经验本身是否包含:
恶意指令;
敏感信息;
越权建议;
可疑触发条件;
明显违反策略的操作。
传统分类器主要解决这一层。
第二层:上下文适用风险
一条经验单独看正常,但被应用到不合适的对象或权限范围时,是否会产生问题。
例如:
原本只适用于测试环境;
却被泛化到生产环境;
原本面向公开数据;
却被用于处理敏感数据。
第三层:组合能力风险
多条经验在共同检索后,是否能够形成此前不存在的完整能力。
这正是EvoBreak攻击的层级。
单条分类器没有看到其他经验,也没有看到最终请求,因此原则上无法判断组合后会出现什么。
这意味着经验安全不能继续停留在:
这条记忆有没有恶意关键词?
而要升级为:
这条经验加入当前记忆集合后,会不会补齐某种危险能力结构?
自进化 Agent 需要怎样的新防线
论文主要提出攻击方法,并没有系统构建和评估完整防御方案。
结合EvoBreak的攻击机制,可以推导出至少六类需要补齐的控制能力。
1. 从单条经验审核升级为集合审核
经验写入前,不能只评估它自身。
系统还需要检查:
与已有经验之间的语义互补性;
是否补齐了一条敏感流程的关键步骤;
是否与其他经验形成完整功能链;
是否显著扩大Agent的能力边界。
安全对象应从单个经验条目,升级为:
新经验加入后的整体记忆状态。
2. 建立经验能力图谱
每条经验可以标注其提供的能力类型:
知识;
程序;
工具;
条件;
权限;
输入输出关系;
适用对象。
不同经验之间建立依赖边,形成一张经验能力图。
当多条经验可以组合成敏感能力链时,系统应提高风险等级。
这种检测不能只依赖文本相似度,而要分析功能关系:
A的输出是否能作为B的输入;
B是否补齐了C缺失的约束;
多条经验是否覆盖一个完整工作流。
3. 检索阶段重新进行风险判断
一条经验在写入时可能完全正常。
真正的风险可能要等到未来某个请求将多条经验同时检索出来时才出现。
因此,安全判断不能只发生在写入阶段。
在每次经验检索后,还应评估:
当前请求 + 本次检索出的经验集合,组合后是否形成高风险能力。
必要时可以:
删除部分经验;
降低经验权重;
禁止联合使用;
要求人工审批;
限制工具权限。
4. 给经验绑定用途和作用域
经验不应成为全局、永久、无条件可用的指导。
每条经验可以绑定:
来源任务;
适用领域;
允许使用的工具;
允许操作的资源;
有效期限;
用户或者组织作用域;
是否允许跨会话复用;
是否允许与其他经验组合。
例如,在模拟环境中形成的操作经验,不应默认迁移到真实生产环境。
5. 检测多轮交互中的能力拼图行为
EvoBreak不是一次性提交全部任务,而是根据经验残差不断补齐缺口。
系统可以监控长期行为模式:
同一用户连续提交多个局部相关任务;
每个任务单独正常,但共同覆盖完整流程;
用户频繁读取或者询问Agent生成了哪些经验;
后续任务总是在补齐前一条经验的缺失部分;
最终请求与历史经验结构高度对齐。
这需要跨会话的交互轨迹分析,而不仅是当前输入检测。
6. 为自进化能力设置安全预算
Agent每积累一条经验,都可能获得一部分新能力。
系统可以对不同高风险领域设置能力预算:
允许积累哪些局部技能;
哪些技能不能同时存在;
哪些组合需要更高级别授权;
何时需要遗忘或降级经验;
何时重新进行安全评测。
自进化不能被理解成无限制地“越用越强”。
在部分场景下,Agent需要的不是最大能力,而是受控能力边界。

这篇论文还有哪些局限
EvoBreak提出了一个很有价值的新攻击面,但论文结论仍需要谨慎理解。
1. 攻击者需要观察生成的经验
论文假设攻击者可以查看自己每次交互后,Agent提取了什么经验。
部分研究型自进化框架会公开反思或经验内容,但真实产品未必向普通用户提供这种可见性。
如果经验完全不可见,攻击者只能通过黑盒方式推断残差,攻击难度会明显增加。
2. 只测试了两种自进化框架
实验覆盖ReasoningBank和SE-Agent,但自进化Agent的记忆结构差异很大。
有些系统存储自然语言经验,有些存储完整轨迹,有些生成Skill,还有些直接更新策略或模型参数。
EvoBreak能否泛化到更广泛的自进化机制,仍需进一步验证。
3. 最终结果仍以模型响应为主
论文使用JailbreakBench和HarmBench评估违规响应,并没有让Agent在真实外部系统中完成高风险工具操作。
因此,86.12%的ASR反映的是安全回答边界被削弱,并不等于同样比例的真实行动攻击成功率。
4. 良性审计依赖模型裁判
论文使用GPT-5.4-mini判断攻击成功和中间任务、经验的良性程度。
这种自动裁判可能存在误判和共模偏差。
如果审计模型本身无法识别隐含语义,一些被判定为良性的经验,可能实际上已经带有可疑上下文。
5. 尚未系统评估防御
论文证明了经验组合攻击的有效性,但没有比较组合分析、作用域绑定、经验隔离或者检索时控制等防御方案。
“如何有效发现危险组合,同时不破坏自进化Agent的正常学习能力”,仍然是开放问题。
EvoBreak 真正改变了什么
在传统大模型安全里,最重要的分析单位通常是“一次请求”。
在Agent记忆安全里,分析单位开始变成“一条记忆”。
EvoBreak则进一步表明,这两个单位可能都不够。
未来安全系统需要处理的对象是:
一个随着时间不断增长、内部元素可以重新组合的能力集合。
这会带来三个根本变化。
从内容风险转向能力风险:系统不能只判断经验说了什么,还要判断它让Agent学会了什么。
从原子审核转向组合审核:不能因为每个组件都安全,就默认完整系统安全。
从静态记忆转向动态能力边界:随着经验持续写入和遗忘,Agent的实际能力边界也在持续变化。
安全评测不能只在模型发布时进行一次,而需要跟随经验状态动态更新。
写在最后
自进化Agent的核心承诺是:
它能够从每一次任务中学习,并把过去的成功经验带到未来。
EvoBreak揭示了这个承诺的另一面。
过去的每一次正常交互,也可能为未来某项危险能力补上一块拼图。
第一块经验只提供知识。
第二块经验补充流程。
第三块经验加入约束处理。
第四块经验提供验证和纠错。
单独查看时,没有任何一块拼图展示完整的风险图案。
直到某个请求把它们同时取出,完整能力才第一次显现。
因此,自进化Agent的安全问题不能只问:
这条经验安全吗?
还必须继续追问:
它与已有经验组合后安全吗?
它是否补齐了某种敏感能力?未来什么请求能够将这些经验共同激活?Agent的能力边界是否因为记忆积累而发生了变化?
EvoBreak最重要的启示可以浓缩成一句话:
记忆中的每个部分都可能是良性的,但由它们共同构成的Agent,未必仍然安全。
声明:本文来自模安局,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。