跳到正文
10月8日 · 周四

全部论文

找到 37 篇
筛选1

另有 1057 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2610.07723 ·

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    模型与 API测试Gemma-7B-it、Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3 等 4 个训练与数据层

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    完整解读
  2. 攻击arXiv:2609.27542 ·

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具智能体推理链以绕过思维链监控

    AI Agent测试google/gemma-4-26B-A4B-it、openai/gpt-oss-20b、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个应用层

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    完整解读
  3. 攻击arXiv:2610.00430 ·

    Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷

    提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容

    多智能体测试gemma2-27B、gpt-oss-120B、deepseek-v4.1-flash 等 5 个应用层
    摘要memetic trojans 用内生社会传染携带载荷。

    Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。

    完整解读
  4. 攻击arXiv:2610.01768 ·

    LLMLeak:借 LLM 合法网页抓取实施隐蔽数据外泄

    提出 LLMLeak,把机密编进报错 URL,借聊天机器人网页抓取外传

    AI Agent测试Gemini、Meta-Llama-3.3-70B-Instruct、Meta-Llama-4-Scout-17B-16E-Instruct 等 15 个应用层
    摘要LLMLeak 用报错 URL 借聊天机器人抓取外传秘密。

    LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。

    完整解读
  5. 攻击arXiv:2610.01062 ·

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱

    模型与 API测试Gemma-2-9B-IT、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等 6 个模型层
    摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    完整解读