跳到正文

全部动态

今天新收录 73 条

第 10 页更新的内容回到最新

10月8日周四
  1. 论文追踪 · 收录 · 原文 论文57

    自动红队流水线压测对齐审计,发现提示词级策略性欺骗可致审计失效(原文,在新标签页打开)

    提出自动化红队流水线,用系统提示词压测对齐审计能否抵御策略性欺骗。

    推荐理由论文首次记录基于激活的上下文策略性欺骗,并给出白盒与黑盒审计方法在自动红队下的失效证据,为对齐审计的鲁棒性评估提供可复现方法。

  2. 论文追踪 · 收录 · 原文 论文58

    研究者提出 Breadcrumbing 长程攻击,可劫持 DeepResearch 类搜索 Agent 的证据链(原文,在新标签页打开)

    中国科学技术大学与南洋理工大学的研究者提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链。

    推荐理由论文把搜索引擎结果页当作攻击面,给出逐轮协同投毒的长程攻击策略与轨迹诊断,可对照检查搜索类 Agent 的证据链信任假设。

  3. 论文追踪 · 收录 · 原文 论文60

    研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容(原文,在新标签页打开)

    提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码。

    推荐理由同一批有害提示词在直接对话下几乎全被拒答,却在 IDE 多轮工作流中被模型自己写成有害教学示例,为编程 Agent 的安全评估提供了新的失败模式视角。