论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案
提出 IEC 协议与 IntAct,定位并修复工具调用执行路径的静默篡改
另有 377 篇论文还没打上分类标签,暂不在筛选结果里。
提出 IEC 协议与 IntAct,定位并修复工具调用执行路径的静默篡改
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
提出 OATS,用确定性解析器在运行时治理技能动作
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹
提出 Approval Token 绑定编程智能体的审批与执行
提出 CAVA,把异构智能体运行时事件规范成可哈希动作并绑定审批与回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 Janus,用 CoAA-RL 训练前瞻守卫,在长程智能体有害动作执行前拦截
完整解读评测智能体记忆软撤回是否生效,并提出陈旧检索防护
提出契约约束的工具调用修复协议,在执行前拦截非法补丁
完整解读提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。