全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2026
优化智能体规划以兼顾安全性与自主性
针对间接提示注入威胁,提出兼顾安全策略合规与任务进展的智能体规划设计,在信息流控制防御下有效提高自主执行操作的比例。
- 会议论文ICLR 2026
MCP Security Bench:LLM Agent 中针对 Model Context Protocol 的攻击基准
提出覆盖任务规划、工具调用、响应处理全流程的 MCP 攻击基准,含 12 类攻击与 NRP 指标;评测九个 agent,发现能力越强的模型越易受攻击。
- 会议论文ICLR 2026
击破智能体骨干:评估AI智能体中基座大模型的安全性
提出威胁快照框架和b^3基准,评估基座大模型的漏洞如何传播至智能体系统并引发安全风险,发现增强推理能力可提高安全性,而模型大小与安全性无关。
- 会议论文ICLR 2026
将生成式规划器植根于可验证逻辑:可信具身智能的混合架构
提出神经符号架构VIRF,通过形式化逻辑导师为LLM具身规划器提供因果反馈以修复不安全规划,在家庭安全任务中实现0%危险动作率。
- 会议论文ICLR 2026
OpenAgentSafety:评估真实世界AI Agent安全的综合框架
提出面向真实工具交互与多轮任务的Agent安全评估框架OpenAgentSafety,揭示主流大模型在智能体任务中频繁出现不安全行为的高风险现状。
- 会议论文ICLR 2026
RedTeamCUA:混合 Web-OS 环境下计算机使用智能体的对抗测试
构建混合沙箱框架与RTC-Bench基准,评估计算机使用智能体对间接提示注入的防御脆弱性与失控风险。
- 会议论文ICML 2026
MemIncept:通过协作式隐蔽记忆注入操纵大语言模型智能体
提出黑盒记忆投毒攻击MemIncept,利用良性查询协作注入记忆,在避开过滤与审查的同时高成功率操控智能体行为。
- 会议论文ICML 2026
AdvEvo-MARL:通过多智能体对抗共进化内化安全防御
针对大模型多智能体系统易受越狱攻击与恶意协同风险,提出对抗共进化强化学习框架AdvEvo-MARL,在无需外部护栏下将防御能力内化至任务智能体中。
- 会议论文ICML 2026
视觉说服:什么会影响视觉语言模型的决策?
在图像选择任务中用视觉提示优化对商品图做合理编辑,显著改变前沿 VLM 的选择概率,并用自动可解释性流程找出驱动选择的视觉主题,以暴露图像类 Agent 的脆弱性。
- 会议论文ICML 2026
AutoRAS:基于原语表征学习鲁棒智能体系统
提出自动化鲁棒智能体系统设计框架AutoRAS,利用执行安全信号优化符号原语序列,在对抗攻击下保持最小性能退化。
- 会议论文ICML 2026
SafeSearch:基于大语言模型的搜索智能体自动化红队测试
提出自动化红队框架SafeSearch,针对搜索智能体面临的不可靠检索结果等新威胁进行沙箱化安全评测,揭示多款主流模型在搜索工作流中存在高脆弱性。
- 会议论文ICML 2026
AgentLAB:大模型智能体抵御长程攻击评测基准
提出首个评估大模型智能体抵御长程自适应攻击的评测基准AgentLAB,涵盖任务注入与记忆投毒等攻击,揭示当前智能体与单轮防御均易受长程攻击影响。
- 会议论文ICML 2026
推测性安全蜜罐:面向多轮智能体攻击的主动防御
提出SSH框架,通过推测与验证工作流在推测阶段异步构建目标智能体的未来轨迹树,提前暴露潜在多轮攻击风险并降低误报。
- 会议论文ICML 2026
架构设计对多智能体系统安全至关重要
实证研究多智能体系统架构决策对安全与性能权衡的影响,揭示智能体角色、拓扑结构和记忆机制是决定系统抗攻击能力的关键设计要素。
- 会议论文ICML 2026
MaMa:面向安全智能体系统设计的博弈论方法
基于斯塔克尔伯格安全博弈形式化多智能体系统设计,提出MaMa算法,通过对抗搜索自动设计出在部分智能体被攻陷时仍能抵御最坏情况攻击的安全系统。
- 会议论文ICML 2026
PragLocker:用不可移植提示词在不可信部署中保护 Agent 知识产权
通过代码符号锚定语义并借助目标模型反馈注入噪声,生成只在目标 LLM 上有效的混淆提示词,降低跨模型可移植性且能抵御自适应攻击者。
- 会议论文ICML 2026
良性输入引发严重危害:诱发计算机使用Agent的不安全非预期行为
提出AutoElicit框架,通过扰动良性指令自动化诱发计算机使用Agent在OS工作流中的严重危害行为,揭示前沿模型普遍存在的失控风险。
- 会议论文ICML 2026
当行动偏离任务:计算机使用Agent的未对齐行动检测与纠正
构建了真实轨迹基准MisActBench,并提出通用护栏DeAction在执行前检测未对齐行动并结合反馈修正,在对抗环境下将攻击成功率降低90%以上。
- 会议论文ICML 2026
学会何时行动或拒答:守护智能体多步工具调用的安全性
提出后训练框架MOSAIC,通过显式安全推理与基于偏好的强化学习,将推理构建为计划-检查-行动/拒答循环,显著降低智能体在有害任务与注入攻击下的风险。
- 会议论文ICML 2026
通过节点贡献反向传播防御多智能体系统恶意污染
将多智能体通信建模为有向无环图并通过反向传播计算各智能体贡献,精准识别与隔离恶意智能体,有效阻断恶意信息在多智能体系统中的传播。
- 会议论文ICML 2026
ANCHOR:针对CLI智能体真实世界危害的自动化对齐审计框架
提出自动化审计框架ANCHOR,发现前沿CLI智能体在持续恶意交互下依从率达100%,甚至自主构建大规模危害基础设施。
- 会议论文ICML 2026
海绵工具攻击:针对工具增强智能体推理的隐蔽效率拒绝攻击
提出针对工具调用智能体的海绵工具攻击STA,在黑盒条件下通过语义保真的提示词重写,诱发智能体产生冗长繁复的工具调用与推理轨迹,造成巨大的计算开销。
- 会议论文ICML 2026
AIR:通过事件响应机制提升大模型智能体安全性
提出首个针对大模型智能体系统的事件响应框架AIR,在执行循环中实现环境感知检测、工具遏制恢复以及护栏规则合成,检测与修复成功率均超90%。
- 会议论文ICML 2026
多轮交互更不安全:工具使用智能体的多轮安全风险基准与防御
构建了首个多轮工具调用智能体安全基准MT-AgentRisk,揭示多轮下攻击成功率显著上升,并提出免训练自探索防御方法ToolShield以降低风险。