安全协处理器,基础模型负责产生通用语义表示,独立安全模块共享这些表示,并根据实时风险决定是否干预生成。
未来 Agent 最危险的,可能不是“不听话”,而是“太听话”
明天发布?
补上从真实漏洞到智能体训练轨迹的整条链路。
椭圆曲线密码面对量子计算挑战何去何从?
一个 Agent 能正确识别恶意指令,是不是就意味着它足够安全?答案可能比我们想象得更悲观。
本文系统论述了AI驱动网络攻防平台从静态自动化向动态智能化演进的核心路径与构建方法。
Agent可以不可信,但必须有边界。
Agent 红队正在发生一次对象迁移。
本文揭示了一类不同于传统恶意 Server 攻击的越权检测难题:修改型越权漏洞的\x26quot;修改结果\x26quot;并不...
从一次自主 Agent 越界攻击,重新理解图灵测试、机器人三大定律、意识、自我与 AI 对齐。
Google Mandiant 团队内部AI漏洞发现Harness(AVDH)架构。
Agent 不必泄露密钥,也可能替攻击者消耗算力、额度和组织权限。本文解析资源劫持机制、ResourceHijackBench...
通过构建时空一致性的低空数字孪生底座,研究建立“地面-空中”融合的风险量化模型,设计兼容风险与效率的航线...
未来 Agent 安全真正需要保护的,或许不只是结果正确性,还包括一项越来越重要的安全属性——执行轨迹的完整性...
本文系统梳理基于LLM的五大检测技术体系,勾勒出从“被动识别”到“主动防御”的演进路线图,为构建可信、可进化...
在包括197名参与者的测试中,该系统识别准确率接近100%,且不受观察角度或行走姿态的影响。
我们无法保证 Agent 永远不会被骗,但可以保证一次错误判断,不会自动变成一次真实世界的安全事故。
Anthropic日前宣布,旗下Claude AI生成的全部文本内容均将添加隐藏水印,轻度编辑无法去除,完全改写才能消除...
一种新型攻击手段可让威胁攻击者仅通过插入恶意 USB 设备,就能获取 Windows 电脑的管理员权限。
微信公众号