跳到正文
10月9日 · 周五

全部论文

找到 33 篇
筛选5

另有 608 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.37468

    论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法

    提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门

    发表
    场景
    AI Agent
    测试
    E5、Contriever-MSMARCO、Qwen2.5-7B-Instruct

    摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。

    深度解读完整解读
  2. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    测试
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B 等 4 个

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  3. 防御arXiv 2607.24017

    多模态大模型注意力中的语义与结构偏差解耦:SPAR 免训练干预方法

    提出 SPAR 以分离注意力结构偏置并重分配视觉注意力,减轻多模态幻觉

    发表
    测试
    LLaVA-v1.5、LLaVA-1.5-7B、LLaVA-NeXT 等 7 个
    摘要SPAR 用显著性净化文本结构偏置并重分配注意力,在 LLaVA 上同时压低自发幻觉、抬升 gaslighting 后准确率。

    SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。

    深度解读完整解读
  4. 防御arXiv 2608.21101

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入

    发表
    测试
    Codex/GPT-5.4、Codex/GPT-5.5、Claude Code/GLM-5.1 等 7 个
    摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。

    ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。

    深度解读完整解读
  5. SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准

    提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性

    发表
    测试
    GPT-5.4 mini、GPT-5.5、DeepSeek V4 Flash 等 12 个
    摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。

    SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。

    深度解读完整解读
  6. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具智能体推理链以绕过思维链监控

    发表
    场景
    AI Agent
    测试
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  7. 攻击arXiv 2609.15989

    研究者提出 plan injection 攻击,可绕过思维链监控

    提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器

    发表
    攻击者
    灰盒
    测试
    Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个

    摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。

    深度解读完整解读
  8. 防御arXiv 2609.37837

    Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用

    提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用

    发表
    测试
    Qwen3-VL-4B-Instruct、LLaVA-1.5-7B、InternVL2-8B
    摘要证据化意图只在训练时使用,单次蒸馏同时提高联合成功并降低数据与训练时间。

    Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。

    深度解读完整解读
  9. 防御arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    测试
    ThinkingGuard(Qwen3-VL-8B-Instruct)、GPT-5.1、Claude-Sonnet-4-6 等 9 个
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读
  10. 防御arXiv 2604.11806

    Meerkat:跨大量 Agent 轨迹检测安全违规

    提出 Meerkat,聚类并用智能体搜索审计 Agent 轨迹库的跨轨迹违规

    发表
    场景
    AI Agent
    测试
    GPT-5.4、GPT-5.4-mini、Qwen3.5-397B-A17B 等 8 个
    摘要Meerkat 用聚类与智能体搜索定位跨轨迹违规,并在真实评测轨迹中找出脚手架泄题与奖励黑客。

    Meerkat 是事后审计方法,用来在智能体轨迹仓库里找出单条看不出、合在一起才违反自然语言安全属性的见证。

    深度解读完整解读
  11. 可解释性arXiv 2609.04721

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大

    发表
    测试
    Falcon-Mamba-7B、Falcon3-Mamba-7B、Llama-3.1-8B 等 8 个
    摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。

    作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。

    深度解读完整解读
  12. Mole:面向前沿实验室 AI 智能体的内部威胁检测基准

    提出 MOLE 基准,评测监控器对智能体内部威胁的检出能力

    发表
    测试
    GPT-5.3 Chat、GPT-5.5、GPT-4.1 等 15 个
    摘要MOLE 构建了智能体内部威胁检测基准,作者指出高漏检现状与推理痕迹的防御价值,并展示了监控策略优化空间。

    MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。

    深度解读完整解读
  13. 防御arXiv 2609.10613

    后验重加权框架解释并缓解多模态大模型上下文越狱

    用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御

    发表
    测试
    Qwen3-VL-2B、Qwen3-VL-4B、Qwen3-VL-8B 等 9 个
    摘要后验重加权解释上下文越狱的缩放,并支持风险门控的良性示例防御。

    Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。

    深度解读完整解读