全部论文
另有 430 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2609.27542
研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
- arXiv
- 2609.27542
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
- 攻击arXiv 2609.15989
研究者提出 plan injection 攻击,可绕过思维链监控
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
- arXiv
- 2609.15989
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
- 攻击arXiv 2609.08213
DRIFT:通过偏转生成轨迹去除扩散模型水印的黑盒攻击
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
- arXiv
- 2609.08213
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2609.04260
GhostWord:针对自动语音识别的细粒度后门攻击
提出 GhostWord 词级触发后门,对自动语音识别做数据投毒
- arXiv
- 2609.04260
- 发表
- 场景
- 模型与 API
- 攻击arXiv 2609.32400
SkillDRE:用预执行与运行时双阶段反馈自动演化恶意 Agent 技能
提出 SkillDRE,用预执行与运行时反馈演化恶意技能
- arXiv
- 2609.32400
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
已经到底了