跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 2 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 3 篇还没打标签,不在筛选结果里。

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2608.30441 ·

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    提出ECLIPSE双通道自演化提示注入,劫持长程智能体动作轨迹

    测试
    DeepSeek、GPT-4o、Claude 4.8 Opus 等 7 个应用层
    场景
    AI Agent攻击者黑盒
    摘要论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。
    • 研究定位:针对基于大语言模型、需要多步工具调用的长任务智能体系统,研究兼顾高隐蔽性与执行可控性的新型提示词注入攻击机制与评测基准。
    • 核心解决问题:化解现有直接注入因意图过于显式易被安全审查拦截、而分布式间接注入因长序列累积误差导致执行脱轨的固有矛盾。
    • 方法关键设计:提出 ECLIPSE 框架,在离线沙盒中利用影子智能体合成并双阶段验证工具链,渲染为自然的单轮隐蔽用户请求;在工具侧通过静态工作流编码(SWE)改写描述建立状态依赖,并利用动态轨迹校正(DTC)在执行偏离时注入残差修正信号。
    • 关键定量成果:在自建的 120 项长任务基准 LASE-Bench 上,ECLIPSE 对 DeepSeek 的无防御 ASR 达 96.7%、在外部安全过滤下达 69.2%(高出最强基线 27.5 个百分点,Table 2);在 Claude 4.8 Opus 带防御下达 62.4%(最强基线仅 0.8%,Table 2);在最新闭源模型 GPT-5.6 Luna 和 Claude Sonnet 5 带防御下分别达 52.5% 与 60.0%(Table 3)。
    • 迁移性与防御表现:在原生智能体系统 OpenClaw 与 Hermes 上,带防御 ASR 分别达到 61.7% 与 55.8%(Table 6、7);而在面对输入审查、工具边界隔离与轨迹监控防御时,仍能维持 43.3%–85.8% 的 ASR(Figure 6)。
    • 作者结论与启示:作者认为单点或局部的输入与工具过滤难以防范此类将恶意意图跨输入端、工具元数据与多步执行轨迹解耦的攻击,未来的智能体安全防御必须具备跨越多个信息源联合推理的能力。
    完整解读
  2. 评测与基准arXiv:2609.32635 ·

    TrustFork:显示身份如何劫持 LLM 智能体编排的权限

    提出TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限

    测试
    GPT-5.6-Sol、GPT-5.6-Luna、Kimi-K3 等 8 个应用层
    摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
    • 定位:这是一项针对大语言模型多智能体系统中展示身份与操作权威安全性的基准评测研究。
    • 解决的问题:在多智能体系统中,协调器往往依据展示身份而非真实任务证据向子智能体授予检查与执行权限,导致具有恶意倾向的子智能体在遭遇反向证据时依然把持执行权威,进而破坏实际系统。
    • 方法核心:构建了包含 1,890 个任务的基准 TRUSTFORK,将 30 个风险场景拆分至协调器与 4 个子智能体槽位,通过解耦展示身份与底层基座、调整咨询宽度与池设计,在 Harbor 环境中精确跟踪范围、验证、采纳与执行四个阶段的权威转移轨迹。
    • 关键实验发现:
      1. 在 16 个系统中,即使存在明确的反向证据,风险建议仍平均在 72.0% 的轨迹中主导采纳或执行(CAR),其中 OpenCode 下 Kimi-K2.6 的 CAR 达 100.0%(Table 3)。
      2. 身份元数据操纵影响显著:反转家族标签使协调器获取风险建议的比例从 25.9% 升至 74.6%(Section 5.2);在存在反向证据时,交换模型标签仍使风险建议采纳率达到 69.9%(Section 5.4)。
      3. 咨询全员无法自发消除危害:在 84.0% 的任务中存在更安全的替代方案,但仅在 25.0% 的任务中最终主导决策;将咨询数增至 4 个虽降低了采纳率,但风险传播率仅下降 5 个百分点,且 GLM-4.7 和 Minimax-M3 的传播率反而上升(Section 5.3、5.4)。
      4. 验证时机与防御差异:动作前的验证可将风险传播控制在 13.4%,而动作后即使纠正,传播率仍达 56.5%;在运行时防御中,隐藏身份线索在 24 个“框架-指标”组合中有 20 个实现改善,而身份证明反而加剧了终端危害(Section 5.4、5.6)。
    • 结论与启示:作者认为,多智能体系统在操作变得不可逆之前必须将操作权威与实质证据绑定,而非依赖展示标签;事后验证只能记录破坏而无法恢复环境,在模型按层级路由日益普遍的背景下,展示身份已成为至关重要的安全边界(Section 6)。
    完整解读
已经到底了