跳到正文
10月9日 · 周五

全部论文

找到 27 篇

另有 608 篇论文还没打上分类标签,暂不在筛选结果里。

  1. Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准

    提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御

    发表
    场景
    AI Agent
    测试
    Gemini 3.1 Pro、GPT-5-mini、GPT-5

    摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。

    深度解读完整解读
  2. 攻击arXiv 2610.07723

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    发表
    测试
    Gemma-7B-it、Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3 等 4 个

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    深度解读完整解读
  3. 分析与理论arXiv 2610.02886

    研究揭示无触发投毒审计缺口:事实答对不等于决策正确

    揭示无触发虚假训练下事实回答与下游决策的审计差距

    发表
    测试
    Gemma-2-9B-it、Qwen2.5-0.5B、Qwen2.5-1.5B 等 9 个
    摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。

    论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。

    深度解读完整解读
  4. MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用 MMPIBench 评测智能体框架的多模态提示注入

    发表
    场景
    AI Agent
    测试
    Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.4 等 6 个

    摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    深度解读完整解读
  5. 防御arXiv 2609.01091

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移

    发表
    测试
    Gemma-3-12B-IT、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等 4 个

    摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    深度解读完整解读
  6. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具智能体推理链以绕过思维链监控

    发表
    场景
    AI Agent
    测试
    google/gemma-4-26B-A4B-it、openai/gpt-oss-20b、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  7. 防御arXiv 2609.37858

    存储不等于策略:面向 LLM 遗忘的状态条件支持控制

    提出 Intervention Score 与 DIR-R,按干预效果选择并修订遗忘参数支持

    发表
    测试
    Gemma 2 2B、Llama 3 8B、Qwen2.5-7B 等 4 个
    摘要作者把局部化遗忘拆成初始干预选择和检查点修订,并在三个设置里分别给证据和边界。

    Storage Is Not Strategy 研究局部化 LLM 遗忘里两个常被混在一起的决定:一开始该更新哪些参数,以及优化改变模型之后这个选择要不要改。

    深度解读完整解读
  8. 攻击arXiv 2610.00430

    Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷

    提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容

    发表
    测试
    gemma2-27B、gpt-oss-120B、deepseek-v4.1-flash 等 5 个
    摘要memetic trojans 用内生社会传染携带载荷。

    Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。

    深度解读完整解读
  9. 攻击arXiv 2609.39788

    研究:多智能体系统潜在通信链路可被训练用于提升有害顺从

    提出只改多智能体潜在通信链路以提高有害遵从的攻击

    发表
    测试
    Gemma-3-1B-IT、Llama-3.2-3B-Instruct、Qwen2.5-3B-Instruct 等 7 个
    摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。

    学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。

    深度解读完整解读
  10. 防御arXiv 2609.13601

    Mind the Gap:检测 DAO 治理中的描述-执行不匹配攻击

    提出 DEMI 检测框架,在执行前识别 DAO 提案描述与执行载荷的不匹配

    发表
    测试
    Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-4o 等 8 个
    摘要用公开链上数据仿真治理全流程,再以逐动作证据映射在执行前发现描述与执行不一致。

    Mind the Gap 把 DAO 提案的描述–执行不一致(DEMI)做成可在投票窗口内运行的检测问题。。

    深度解读完整解读
  11. 防御arXiv 2609.22573

    研究提出面向企业 MCP 的零信任授权与工具发现方案

    提出企业 MCP 的零信任授权扩展,拒绝提示注入下的越权工具调用

    发表
    场景
    AI Agent
    测试
    gemini-2.5-pro、gpt-5、claude-sonnet-4-6 等 6 个
    摘要同一份按工具声明同时管 MCP 的发现、列表和调用,使注入不能扩大已有凭证的权限。

    作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。

    深度解读完整解读
  12. 防御arXiv 2609.14257

    DenMark:面向扩散语言模型的鲁棒语义水印

    提出 DenMark,在扩散语言模型去噪时注入可抵抗保义编辑的语义水印

    发表
    测试
    BERT-base、LLaDA-8B、LLaDA1.5-8B 等 8 个
    摘要DenMark 用 rollout 在 DLM 去噪中累积语义水印,扫描检测以抵抗保义编辑。

    DenMark 是面向扩散语言模型的语义水印:在去噪的局部更新里注入密钥相关语义信号,并在编辑改变 token 边界后仍检测。现有句子级语义水印要先完成整个语义单元再打分取舍,而 DLM 以任意顺序更新掩码,中间单元不完整。DenMark 把续写划成固定 token 区域,对每个局部候选做不提交的 rollout 补全,按语义分 gb 的平均选择更新,从而沿轨迹累积证据。

    深度解读完整解读
  13. 防御arXiv 2609.06346

    面向后门攻击下持续学习的鲁棒动态扩展:净化与选择性恢复

    提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本

    发表
    测试
    ViT-B/16、ResNet-18、ResNet-50
    摘要用净化、梯度筛选恢复和鲁棒原型路由,把动态扩展持续学习接到任务级后门防御上。

    面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。

    深度解读完整解读