攻击arXiv 2609.39065
TrustProbe 在 11 个开源 Agent 中发现 104 个技能信任链漏洞
提出 TrustProbe,挖掘技能智能体中不可信 skill 到特权操作的信任链漏洞
- arXiv
- 2609.39065
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- OpenClaw、OpenCode、Hermes Agent 等 11 个
提出 TrustProbe,挖掘技能智能体中不可信 skill 到特权操作的信任链漏洞
提出任意字母置换密码越狱,无需微调即可诱导有害输出
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
提出针对 Agent 护栏的推理扩展拒绝服务攻击
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出层级遗传算法 HGA,扰动题目逻辑结构诱发推理模型过度思考
摘要HGA 在黑盒推理模型上用逻辑扰动拉长输出,作者称可从小代理迁移,查询成本是其局限。
用简历中的不可见指令做间接提示注入,操纵招聘推荐
摘要作者称推理在简单注入下会帮攻击圆谎,在不合逻辑的复杂注入下又会把欺骗漏出来。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出 ARE 框架与图像文本攻击,评测多模态网页 Agent 的对抗鲁棒性
摘要系统评估多模态网页智能体的脆弱性,指出推理时计算组件被攻破会加剧系统风险。