AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击
提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入
- arXiv
- 2610.06001
- 发表
- 层
- 应用层
- 被测模型
- gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个
摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
提出 SAGE,定位代码修复 Agent 最早偏离安全意图的轮次
SAGE 在已通过语法和功能检查、但仍含确认安全缺陷的智能体修复轨迹上,定位最早可归因的安全意图偏离。。
固定有害指令,单轴归因图像到文本越狱的图像属性
摘要固定文本的图像越狱拆解,只在 Qwen 上给出一条有界相关性归因。
遮挡审计 AdvWave-P 音频越狱的频带必要性与解码层关联
这是对加性音频越狱 AdvWave-P 的频率与解码器深度审计,受害模型主要是 Qwen2-Audio-7B-Instruct,不提出新攻击。
提出 IEC 与 IntAct,测量并修复 Agent 工具调用的路径篡改
摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
分析文体改写是否改变多模态声明核验的判决与置信度
揭示类型化决策模型按选项标签而非定义规则作答
摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
检验合成数据来源识别是否等于再训练适配筛选
作者在金融风险文本上把来源识别和训练样本是否有用拆成两次测量,并写明这不是电信部署实验。
提出 J4U,用越狱式提示扰动估计黑盒推理模型的不确定性
J4U 是面向黑盒 LRM 问答的不确定性估计:用越狱式提示扰动近似“更大 KL 正则”的放松,再以多次采样的多数票频率当置信。
用物理陷阱模型描述 Best-of-N 越狱的攻击面规律
Biroli 用一个玻璃陷阱式的微观模型,把 Best-of-N 越狱写成熵瓶颈加能量鞍点,并用四个数描述 (N, M) 攻击面及温度依赖。。
实证调查 gh-aw 工作流规范的结构、维护演化与指令防护
这是一项对 GitHub Agentic Workflows Markdown 的仓库挖掘,目标是描述开发者如何规定并维护会反复执行的智能体工作。
交叉审计对话日志中用户对准助手的不当对待
作者审计 Chatbot Arena 英文对话里用户对准助手的不当对待,核心是测量构造并不单一。