评测与基准arXiv 2610.07359
论文实测 Agent 工具调用门控栈的失败相关性
提出 nmult,实测 Agent 动作门控栈的层间错误相关性
- arXiv
- 2610.07359
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 风险Agent 危险操作
- 组件权限与沙箱
摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
提出 nmult,实测 Agent 动作门控栈的层间错误相关性
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
提出 ASA 攻击与 AttestMCP 防护,度量并降低输入扰动敏感
提出 TACIT,从冻结内部表征检测智能体有害轨迹
摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。
提出 Sentinel-RL,将拓扑推理卸载到图策略并约束遏制动作
Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。
提出 VoxParity 基准,评测语音智能体是否按音频改变工具调用
VoxParity 测量语音智能体在词语不变、只有声音改变时,是否按行业规则改它所执行的工具调用。