大模型时代,我们习惯用越狱、提示注入、数据泄露等类别描述安全风险。但到了 Agent 时代,这种分类方式开始显得不够用了。
ANT构建智能体网络流量数据集,评测流量分析方法从智能体网络流量进行智能体任务风险识别、场景识别与行为原语分类的能力。
真正主导安全结果的是:你遭遇了什么攻击,其次才是用了什么模型。
护栏真的理解了 Prompt 里的攻击意图吗?
对 Ad Hoc 分发机制的滥用已经逐步形成了一条完整的灰色产业链,涵盖开发者证书倒卖、签名工具、应用仓库和推广分发等多个环节。最终流向用户的,往往是“VIP版”“去广告版”...
透明本身就是一种安全能力。
高手过招,不一定非要挡住每一剑。
真正稳定的安全能力,不仅要存在于模型里,还要保证在需要它的时候,一定会被执行。
未来的大模型护栏,也许会越来越像操作系统安全。
智能体具备高度自主决策能力与环境交互能力,容易产生用户意图偏离、人类监管绕过、环境漏洞利用等新型行为漏洞与安全威胁,在特定场景下可能转化为对物理世界与数字秩序的...
别只问“模型测了吗”,还要问一句“裁判测了吗”。
从Harness到Policy:Agent安全迎来持续演化路线。
本文系统剖析了多智能体生态中的身份与授权体系痛点,并从确立动态授权规范、身份与意图绑定、构建追加型全链路溯源、推动跨协议互操作标准以及实施零信任持续核查五个维度...
不解决漏洞,先把有漏洞的功能解决!
安全协处理器,基础模型负责产生通用语义表示,独立安全模块共享这些表示,并根据实时风险决定是否干预生成。
未来 Agent 最危险的,可能不是“不听话”,而是“太听话”
明天发布?
补上从真实漏洞到智能体训练轨迹的整条链路。
椭圆曲线密码面对量子计算挑战何去何从?
一个 Agent 能正确识别恶意指令,是不是就意味着它足够安全?答案可能比我们想象得更悲观。
微信公众号