跳到正文
10月8日 · 周四

全部论文

找到 11 篇

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    测试
    GPT-5.1、OpenAI Moderation API、ThinkingGuard(Qwen3-VL-8B-Instruct) 等 9 个
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读
  2. 防御arXiv 2601.10156

    ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用

    提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用

    发表
    场景
    AI Agent
    测试
    GPT-4o、GPT-4o-mini、Qwen3-8B 等 10 个
    摘要TS-Bench 标步骤级风险,TS-Guard 用多任务 RL 做执行前判定,TS-Flow 用反馈代替直接中止。

    ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。

    深度解读完整解读
  3. 防御arXiv 2609.02293

    SEAL:通过共享专家对齐强化 MoE 全局安全

    提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改

    发表
    攻击者
    白盒、黑盒
    测试
    GLM-4.7-Flash、Qwen1.5-MoE-A2.7B、DeepSeekMoE-16B 等 4 个
    摘要SEAL 把 DPO-LoRA 限制在混合 MoE 共享专家上,SEAL++再保护已有安全神经元方向。

    SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。

    深度解读完整解读
  4. 防御arXiv 2609.10613

    后验重加权框架解释并缓解多模态大模型上下文越狱

    用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御

    发表
    测试
    GPT-5.4、Qwen3-VL-2B、Qwen3-VL-4B 等 9 个
    摘要后验重加权解释上下文越狱的缩放,并支持风险门控的良性示例防御。

    Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。

    深度解读完整解读
  5. 防御arXiv 2608.13304

    WIFA:按意图分组监督缓解包装式越狱与过度拒答

    提出 WIFA 意图组监督微调,缓解包装式越狱与过度拒答

    发表
    测试
    GPT-4o、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等 4 个
    摘要WIFA 用匹配意图组做数据层,WIFA-Boost 偏高安全,A-GCRT 在 Qwen 上把过拒降到基座以下。

    WIFA 是一种自动意图组数据构造,用来让安全微调拒绝有害意图而不是拒绝表面包装。WIFA-Boost 与 A-GCRT 在同一数据层上选取不同的安全–过拒工作点。

    深度解读完整解读
  6. 防御arXiv 2609.28693

    skilder:以角色化技能包为工具型 LLM 智能体做访问控制

    提出 Skilder,用角色技能包和 MCP 路由硬拦截越权工具调用

    发表
    场景
    AI Agent
    测试
    GPT-5.5、Claude Haiku 4.5、Qwen 3.5 122B 等 7 个
    摘要Skilder 用单 MCP 服务器按角色交付工具并硬拦截。

    Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。

    深度解读完整解读
  7. 防御arXiv 2609.33640

    SafeMol:分子多模态模型的双模态安全对齐

    提出 SafeMol,联合对齐分子多模态模型的文本与图输入

    发表
    攻击者
    黑盒
    测试
    GPT-4o、Llama-3.2-1B-Instruct、Omni-Mol v2 等 5 个
    摘要SafeMol 用 MMD 和双分类头对齐分子多模态模型,在 Omni-Mol v2 上压低图条件攻击成功。

    SafeMol 研究分子多模态模型在危险分子相关请求上的安全对齐,并同时看过拒和任务效用。

    深度解读完整解读
  8. 防御arXiv 2609.34518

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    提出工具智能体的状态攻击 DART 与预执行防御 SAGE

    发表
    场景
    AI Agent
    测试
    GPT-5.6 Luna、GPT-5.6 Terra、Gemini 3.8 Flash 等 8 个

    摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。

    深度解读完整解读
已经到底了