未来 Agent 安全真正需要保护的,或许不只是结果正确性,还包括一项越来越重要的安全属性——执行轨迹的完整性与必要性。
本文系统梳理基于LLM的五大检测技术体系,勾勒出从“被动识别”到“主动防御”的演进路线图,为构建可信、可进化的下一代虚假信息防御体系提供指引。
在包括197名参与者的测试中,该系统识别准确率接近100%,且不受观察角度或行走姿态的影响。
我们无法保证 Agent 永远不会被骗,但可以保证一次错误判断,不会自动变成一次真实世界的安全事故。
Anthropic日前宣布,旗下Claude AI生成的全部文本内容均将添加隐藏水印,轻度编辑无法去除,完全改写才能消除;该水印采用Google DeepMind提出的SynthID-Text方案,让模型...
一种新型攻击手段可让威胁攻击者仅通过插入恶意 USB 设备,就能获取 Windows 电脑的管理员权限。
思维链是一种新的安全资产。
当大模型开始控制机器人,Prompt Injection 也开始从屏幕走进现实世界。
针对现有公平联邦学习算法局部与全局模型一致性不足和缺乏隐私保护两大问题,本文提出一种基于交替方向乘子法优化的隐私保护公平联邦学习(LDP-FedALF)算法。
只靠一条被安全设备拦截的日志,就能让企业内部的AI代理反过来为攻击者做事。
随着每一代生产模型变得更难攻击,它同时也会给下一代红队模型提供更强的学习信号。
还挖出了用户密钥和密码。
构建了App数据共享行为的网络结构,为App数据共享行为的自动化检测提供了新的解决方案。
Agent 正在从一个“按照规则执行任务的工具”,逐渐变成一个“能够总结经验、修改规则、持续进化的系统”。
给AI装上“神经滤镜”,让恶意特征提取免疫噪声。
记忆中的每个部分都可能是良性的,但由它们共同构成的Agent,未必仍然安全。
Agent 不再只是安全规则的被动执行对象,也可能逐渐成为安全边界的主动探索者。
TCP/IP 协议栈部分处理路径存在校验强度不足。WAVED 以攻击者需要“猜中多少信息”为度量,自动分析 Linux 和 FreeBSD 协议栈,共发现 19 个可被旁路利用的弱验证漏洞,其中...
Unit 42披露针对Google同步Passkey生态系统的三类新型攻击(Pass-ta-key、Silver Pass-ta-key、Golden Pass-ta-key),利用恶意软件在已沦陷终端上绕过用户验证、窃取主密...
从输入输出护栏走向执行控制平面。
微信公众号