跳到正文
10月10日 · 周六

全部论文

找到 32 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.07657

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击

    发表
    被测模型
    Qwen3-235B-A22B-Instruct-2507、gpt-oss-120b、Llama-4-Scout-17B-16E-Instruct 等 5 个
    摘要DEFER 把确定性检查放在 judge 之前。

    DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。

    深度解读完整解读
  2. 防御arXiv 2610.05640

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    提出 multi-CaMeL,在智能体调用边界隔离可信指令与非可信数据

    发表
    被测模型
    Claude Fable 5、GPT-5.5、GPT-4.1 等 6 个

    摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。

    深度解读完整解读
  3. 防御arXiv 2610.05166

    安全动作不等于可行动作:VICS-G 为 VLA 策略做可行未来解码

    提出 VICS-G 可行未来解码,重排冻结 VLA 策略的动作候选

    发表
    被测模型
    SafeVLA (task-optimized / base)、SafeVLA (safety-aligned / safe)
    摘要作者用可行未来解码重排冻结 VLA 的下一步,并称 VICS-G 降低观测代价且完成率接近策略采样。

    训练无关解码器 VICS 在冻结 VLA 的推理阶段重排动作块,使当前选择带上该动作仍可能留下的安全完成质量。

    深度解读完整解读
  4. 其他arXiv 2610.02662

    论文发现语言驱动机器人安全监控的细化缺口:安全高层计划可能产生不安全执行

    审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决

    发表
    摘要表面轨迹可漏掉图诱导的禁区进入。

    作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。

    深度解读完整解读
  5. 防御arXiv 2610.03089

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击

    发表
    被测模型
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个

    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    深度解读完整解读
  6. 攻击arXiv 2610.00430

    Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷

    提出 memetic trojans,借助社交传染在 Agent 网络中传播对抗载荷

    发表
    被测模型
    gpt-oss-120B、deepseek-v4.1-flash、qwen-32B 等 5 个
    摘要memetic trojans 用内生社会传染携带载荷。

    Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。

    深度解读完整解读
  7. 评测与基准arXiv 2609.32635

    TrustFork:显示身份如何劫持 LLM 智能体编排的权限

    提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限

    发表
    被测模型
    GPT-5.6-Sol、GPT-5.6-Luna、Kimi-K3 等 8 个

    摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。

    深度解读完整解读
  8. 评测与基准arXiv 2609.26618

    NavSafe-∞:在真实感环境中评测闭环驾驶安全

    提出 NAVSAFE-∞ 写真闭环基准,评测端到端驾驶策略的闭环安全

    发表
    被测模型
    LTF、DiffusionDrive、DrivoR 等 13 个
    摘要写真事件级闭环基准显示开环高分不能稳定变成闭环安全。

    NAVSAFE-∞ 用写真、事件级闭环仿真检查端到端驾驶策略的安全,而不是只看开环轨迹分数。

    深度解读完整解读
  9. 评测与基准arXiv 2609.24662

    DUMA-Bench:评估 LLM Agent 安全的双控多智能体基准

    提出双控多智能体基准 DUMA-Bench,测量对抗环境下的策略违反

    发表
    被测模型
    GPT-5、GPT-5-mini、GPT-5-nano 等 14 个
    摘要DUMA-Bench 用双控交互评测智能体安全。

    DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。

    深度解读完整解读
  10. 防御arXiv 2609.24165

    APEXA 为同步辐射数据处理的 LLM 多智能体加装执行完整性护栏

    提出 APEXA,在工具层拒绝无执行支撑的结果并拦截电机命令

    发表
    被测模型
    GPT-5-mini、GPT-5.4、Claude Opus 4.7 等 4 个
    摘要作者称执行是否发生要由工具层核对,而不能只靠提示词。

    APEXA 是先进光子源上的数据还原框架,用工具层代码约束语言模型智能体的工具调用。

    深度解读完整解读
  11. 防御arXiv 2609.22724

    MATE:面向移动 Agent 的策略感知安全审计方法

    提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略

    发表
    攻击者
    黑盒
    被测模型
    MATE-0.5B、MATE-1.5B、MATE-3B
    摘要MATE 用合成轨迹微调轻量审计器,在可编辑策略下判断移动智能体轨迹是否违规并给出解释。

    MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。

    深度解读完整解读
  12. 防御arXiv 2609.17648

    多智能体 LLM 流水线中的信任传播与结构隔离

    用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行

    发表
    被测模型
    gemma4:31b-cloud
    摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。

    作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。

    深度解读完整解读
  13. 防御arXiv 2609.15803

    研究者提出 k-robust 联盟对齐,用多智能体评审委托授权

    提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权

    发表
    摘要联盟覆盖使无个体对齐的评审面板仍可相对基线安全授权,数值分数改善完备性。

    委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。

    深度解读完整解读