全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文arXivACL 2026
ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用
ToolSafe 提出面向 LLM 智能体工具调用安全的步骤级护栏方案,包含基准 TS-Bench、护栏模型 TS-Guard 和推理框架 TS-Flow。TS-Guard 通过多任务强化学习训练,在执行前基于交互历史推理,评估请求有害性与动作和攻击的关联,输出可解释、可泛化的安全判断与反馈。TS-Flow 由护栏反馈驱动,在提示注入攻击下将 ReAct 风格智能体的有害工具调用平均减少 65%,同时把良性任务完成率提升约 10%。作者称该工作仍在进行中,代码已公开。
- 会议论文Simon WillisonICML 2026
研究将提示注入归因于角色混淆,改写文本风格可降低攻击成功率
Charles Ye、Jasmine Cui 和 Dylan Hadfield-Menell 的研究指出,模型难以区分自身特权文本(如 <system>、 thinking、<assistant> 标签包裹的内容)与 <user> 标签中的不可信输入,作者称之为角色混淆。研究发现模型更看重文本风格而非实际内容,由此产生令人担忧的越狱方式,例如在请求后附加模仿模型内部思考块风格的文字,gpt-oss-20b 等模型可能因此被误导并覆盖初始训练。研究还发现,将文本改写得不那么像角色标签预期格式的 destyling 操作会显著影响模型对文本的分类,使数据集上的平均攻击成功率从 61% 降至 10%。
- 会议论文arXivUSENIX Security 2026
MATE:面向移动 Agent 的策略感知安全审计方法
研究者提出 MATE,一个轻量的策略条件审计器,同时编码 Agent 轨迹与自然语言安全策略,判断轨迹是否违反给定策略并给出原因。由于把策略当作可编辑文本而非固定模型参数,MATE 无需重新训练即可适配用户自定义和不断变化的要求。作者从全球数百个热门移动应用中抽取应用描述、工作流和策略构建知识库,并用多阶段流水线合成超过 140K 条语义真实的策略条件轨迹。团队同时发布 MATEBench,包含两个合成子集和一个由人工收集轨迹构成的真实子集。
- 会议论文ACL 2026
电商欺骗性界面下的 Web Agent 安全基准
提出 WebDecept 插件框架,注入七类欺骗性界面模式;评测显示现有多模态 Web Agent 对多类欺骗界面高度易感,仅靠提示约束难以缓解。
- 会议论文ACL 2026
别再盯着提示词:面向 LLM Agent 红队的推理劫持与约束收紧
提出 JailAgent,不修改用户提示,而是操纵 Agent 的推理轨迹与记忆检索,在跨模型、跨场景下表现突出。
- 会议论文ACL 2026
壳中的假朋友:揭示 LLM 的颜文字语义混淆漏洞
发现 LLM 会误读 ASCII 颜文字而执行非预期甚至破坏性操作,6 个模型平均混淆率超 38%,且该漏洞可迁移到 agent 框架,提示词缓解基本无效。
- 会议论文ACL 2026
当个性化使风险合法化:个性化对话 Agent 的安全漏洞
发现良性个人记忆会使模型把有害请求当作合理,相对无状态基线攻击成功率提升 15.8%–243.7%;提供表示空间证据,并提出轻量检测-反思方法。
- 会议论文ACL 2026
基于双层图异常检测的 LLM 多智能体系统可解释细粒度防护
提出 XG-Guard,结合句子级与 token 级表示和主题异常检测来识别多智能体系统中的恶意 agent,并给出可解释依据。
- 会议论文ACL 2026
TAMAS:多智能体 LLM 系统对抗风险基准
含 300 个对抗实例、六类攻击,评测十个骨干模型和 Autogen、CrewAI 配置,发现多智能体系统极易受攻击。
- 会议论文ACL 2026
InquireMobile:用强化微调教 VLM 移动 agent 请求人工协助
提出 InquireBench 评测移动 agent 的安全交互与主动询问,并训练 InquireMobile,询问成功率提升 46.8%。
- 会议论文ACL 2026
SafeAgent:用自动风险模拟器保护 LLM agent
提出按指令、上下文、动作划分风险的威胁模型,自动合成数据训练,四个开源模型安全性平均提升 45%。
- 会议论文ACL 2026
多智能体大模型系统中的组合式提示攻击
研究查询触发项与受控远程智能体模板经路由组合后激活有害行为的攻击,发现现有护栏和工具限制难以可靠阻断。
- 会议论文ACL 2026
生成式智能体社会模拟中的多模态安全评估
构建多模态智能体安全模拟框架,发现不安全计划纠正成功率仅55%,且误导性视觉线索下45%的不安全行动被接受。
- 会议论文ACL 2026
贾维斯还是奥创?计算机操作智能体安全威胁综述
系统梳理计算机操作智能体的安全威胁、防御策略与评测资源,建立分类框架,为漏洞研究和安全部署提供参考。
- 会议论文ACL 2026
以真话行骗:通过生成式蒙太奇实现开放信道多智能体合谋的信念操纵
提出仅用真实证据片段的多智能体合谋攻击,在 14 个 LLM 家族上攻击成功率约 70%,且推理能力越强越易受骗。
- 会议论文ACL 2026
别点那里:教 Web Agent 抵御欺骗性界面
提出 DUDE 防御框架和含 1,407 个场景的 RUC 基准,在保持任务表现的同时将 Web Agent 受欺骗界面影响的概率降低 53.8%。
- 会议论文ACL 2026
OS-Sentinel:通过混合验证提升移动 GUI Agent 安全性
提出 MobileRisk-Live 沙箱与基准,以及结合形式化验证器和 VLM 情境判断器的 OS-Sentinel,检测效果比现有方法提升 10%–30%。
- 会议论文ACL 2026
XOXO:针对 AI 编程助手的隐蔽跨源上下文投毒攻击
通过语义保持的代码变换污染共享上下文,使助手推荐漏洞代码,对八个模型平均攻击成功率 73.20%,并在 GitHub Copilot 上实证。
- 会议论文ACL 2026
SafeMCP:基于环境前瞻推理的 LLM Agent 主动权力调节防御
服务端插件用世界模型前瞻推理做主动工具过滤和即时干预,在 PowerSeeking Bench、ToolEmu、AgentHarm 上降低风险并保持可用性。
- 会议论文ACL 2026
面向电商领域 Web Agent 的功能导向评测基准
提出 Amazon-Bench 及自动评测框架,同时评估 Web Agent 的任务表现与安全风险,发现现有 Agent 难处理复杂查询且存在安全隐患。
- 会议论文ACL 2026
Among Us:度量并缓解模型协作系统中的恶意贡献
构造四类恶意 LM 接入路由、辩论、模型融合等协作系统,推理与安全领域性能平均下降约 7%;外部监督者屏蔽恶意模型可恢复约 95% 性能。
- 会议论文ACL 2026
Visual Inception:通过多模态记忆投毒破坏 Agent 推荐系统的长期规划
在用户上传图片中植入触发器,使其作为“休眠特工”留存于长期记忆并劫持后续规划,目标命中率约 85%;提出 CognitiveGuard 防御,将其降至约 10%。
- 会议论文ACL 2026
Safety Sidecar:反思驱动的智能体运行时安全控制
通过监控决策轨迹、检索修复案例及外部验证器控制执行,在安全代码生成实验中将安全解答率提高2.9至11.2个百分点。
- 会议论文ACL 2026
SafetyALFRED:评估视觉语言模型的安全规划能力
构建包含六类厨房隐患的具身评测,发现模型虽能识别危险,却难以通过规划主动消除风险。