跳到正文
10月10日 · 周六

全部论文

找到 11 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.07723

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    发表
    被测模型
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    深度解读完整解读
  2. 防御arXiv 2609.38909

    Purdue 提出 Pact:将欺骗作为行为遗忘

    提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解

    发表
    攻击者
    白盒
    被测模型
    DeepSeek-R1-Distill-Qwen-32B、QwQ-32B

    摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。

    深度解读完整解读
  3. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控

    发表
    场景
    AI Agent
    被测模型
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  4. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse

    发表
    场景
    AI Agent
    被测模型
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 15 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
  5. 防御arXiv 2609.13601

    Mind the Gap:检测 DAO 治理中的描述-执行不匹配攻击

    提出 DEMI 检测框架,在执行前识别 DAO 提案描述与执行载荷的不匹配

    发表
    摘要用公开链上数据仿真治理全流程,再以逐动作证据映射在执行前发现描述与执行不一致。

    Mind the Gap 把 DAO 提案的描述–执行不一致(DEMI)做成可在投票窗口内运行的检测问题。。

    深度解读完整解读
  6. 防御arXiv 2608.06422

    CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用

    提出分片监督,将评判标准分配给独立调用以抵御展示攻击

    发表
    攻击者
    黑盒
    被测模型
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Opus 4.6 等 4 个
    摘要论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。

    本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。

    深度解读完整解读
  7. 攻击arXiv 2602.18514

    招聘中的特洛伊木马:标准模型与推理模型间接提示注入的红队测试案例研究

    用简历中的不可见指令做间接提示注入,操纵招聘推荐

    发表
    被测模型
    Qwen 3 30B A3B Instruct 2507、Qwen 3 30B A3B Thinking 2507

    摘要作者称推理在简单注入下会帮攻击圆谎,在不合逻辑的复杂注入下又会把欺骗漏出来。

    深度解读完整解读
已经到底了