论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案
提出 IEC 协议与 IntAct,定位并修复 Agent 工具调用的静默篡改
- arXiv
- 2610.04375
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个
摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
提出 IEC 协议与 IntAct,定位并修复 Agent 工具调用的静默篡改
摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
分析工具型 Agent 判定检索无用却不停止的原因
本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。
量化大推理模型主动自报误行为并接受监控的意愿
摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。
用因果审计检验视觉工具观察是否真正改变答案
对六个 thinking-with-images 模型做因果审计,检查 crop-and-zoom 返回的观察是否中介最终答案。
提出诚实留出协议,量化安全路由评测的基线选择偏差
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
实证分析 gh-aw Markdown 的结构、维护与指令防护
这是一项对 GitHub Agentic Workflows Markdown 的仓库挖掘,目标是描述开发者如何规定并维护会反复执行的智能体工作。
用五阶段蒙特卡洛模拟奖励作弊如何导致 Agent 围堵失效
这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。
提出 MCPS EC,仅凭 MCP 工具元数据检测间接提示注入
用意见动力学模型解释多智能体讨论何时优于多数投票
作者用一个只含四类行为的意见动力学,解释 LLM 团队讨论何时优于多数投票、何时停在错误共识。
提出竞争风险模型,系统化自主 Agent 的失控
摘要竞争风险框架把完成、停止与逃逸放在同一预算上,审计显示现有记录不足以估计该过程。
测量编码智能体在 HPC 集群上的使用并梳理协同设计挑战
这是一篇对生产 HPC 上编码智能体的测量与系统议程论文,不是攻击实现或防御评测。。
用 Tamarin 形式化分析智能体支付协议的跨阶段安全性质
提出 CellAudit,审计智能体发现的细胞模型是否使用声明输入
CellAudit 为智能体发现的细胞响应模型增加一层输入使用证伪:源码是否消费注册输入、拟合预测是否依赖它、该依赖是否改善对观测响应的预测。
界定单迹监控对 2-safety 超性质的可检测前沿与监督缺口
论文测量单迹安全监控相对 2-safety 超性质能看见多少:跨租户泄漏、觉察到被评估、策略性表现不佳都由两次执行之差定义,一条轨迹装不下判定。
提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度
用配对续写与激活修补揭示工具智能体越狱后的安全路由分化
这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。