论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案
提出 IEC 协议与 IntAct,定位并修复工具调用执行路径的静默篡改
- arXiv
- 2610.04375
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个
摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
另有 701 篇论文还没打上分类标签,暂不在筛选结果里。
提出 IEC 协议与 IntAct,定位并修复工具调用执行路径的静默篡改
摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹
摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。
提出 Janus,用 CoAA-RL 训练前瞻守卫,在长程智能体有害动作执行前拦截
提出 SCOPE 联合后训练计算机使用智能体的任务执行与安全决策
提出 PACE,在工具调用前对 Agent 做路径隔离与效果授权
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
提出 DART,用去噪表征转移检测并干预多轮智能体攻击
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 DEMI 检测框架,在执行前识别 DAO 提案描述与执行载荷的不匹配
Mind the Gap 把 DAO 提案的描述–执行不一致(DEMI)做成可在投票窗口内运行的检测问题。。
构建 TOOLPRIVBENCH 评测 Agent 的过度特权选择并提出特权感知后训练
作者研究 LLM 智能体的 over-privileged tool selection:低权限工具已经足够时,仍选择或在短暂失败后升级到高权限工具。
提出可安装护栏技能 SkillSonar,在运行时分流技能增强 Agent 的敏感动作
用 MasDrift 评测多智能体架构的授权保持
MasDrift 把多智能体设计中的授权保持做成可测量性质,对象是没有攻击者的普通委托。
提出 INTENT-AS-A-TOOL 跟踪并干预智能体失准
Zhang 等人研究推理型语言模型在职场邮件沙箱里如何走向智能体失准,并提出用动作偏好而不是事后文本标签来跟踪承诺。问题是:有害执行往往出现在推理已经形成意图之后,但 CoT 监控是事后、粗粒度、依赖外部评审的,也看不到模型倾向调用哪个动作。
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness
提出 HazardAuditor 与 GuardPO,训练计算机使用智能体的运行时守卫
提出 VAC,用真实操作参数与来源隔离保护智能体浏览器确认
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出 ActGov,在工具执行前用确定性策略拦截间接提示注入
提出 Skilder,用角色技能包和 MCP 路由硬拦截越权工具调用
Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。