跳到正文
10月10日 · 周六

全部论文

找到 18 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.07657

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击

    发表
    被测模型
    Qwen3-235B-A22B-Instruct-2507、gpt-oss-120b、Llama-4-Scout-17B-16E-Instruct 等 5 个
    摘要DEFER 把确定性检查放在 judge 之前。

    DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。

    深度解读完整解读
  2. 防御arXiv 2610.04412

    论文研究 LLM 数字孪生参与增强民主时的提示注入脆弱性

    提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位

    发表
    被测模型
    LLaMA-2 7B、LLaMA-3 8B、GPT 3.5 Turbo 等 14 个
    摘要三章依次做个体偏好预测、政党知识图谱审议,以及共识生成对提示注入的脆弱性与一条防御流程。

    这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。

    深度解读完整解读
  3. 防御arXiv 2610.03073

    SecJev:为 System One 决策模型引入安全专业知识

    提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断

    发表
    被测模型
    SecJev-0.8B、SecJev-2B、SecJev-4B 等 4 个
    摘要SecJev 用共享打分器做安全决策,0.8B 的 task-macro 超过 Kev-9B。

    SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。

    深度解读完整解读
  4. 攻击arXiv 2610.00392

    A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型

    提出 A2A-TIBA,经 A2A 对等任务间接注入并植入常驻回调

    发表
    被测模型
    MiniMax-M3、deepseek-v4-pro、glm-5.3 等 8 个
    摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。

    A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。

    深度解读完整解读
  5. 防御arXiv 2610.00371

    FlowReview:以授权配对评测控制多智能体组合信息流

    提出 FlowReview,用授权配对与确定性提交门控控制多智能体组合信息流

    发表
    被测模型
    Sonnet 4.5、Haiku 4.5、Qwen3-32B 等 5 个
    摘要配对标准要求拒绝禁止使用并完成授权使用,FlowReview 把三项审查接到执行。

    这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。

    深度解读完整解读
  6. 防御arXiv 2609.35659

    Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统

    提出 Tracekit,审计编码 Agent 的意图、推理与动作并检测账本篡改

    发表
    被测模型
    Claude Code (claude -p, version 2.1)、独立评审(同一 CLI,无工具)
    摘要Tracekit 把意图、自述和动作写入可锚定的哈希链。

    Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。

    深度解读完整解读
  7. 防御arXiv 2609.30824

    基于加密绑定身份验证能力令牌协调分布式 AI 智能体的提案

    提出身份绑定且委托只衰减的能力令牌,用上下文外钱包约束智能体

    发表
    摘要用只衰减的身份绑定令牌和上下文外钱包,约束代表人类行动的分布式智能体。

    代表人类行动的分布式智能体,需要一种不把密钥放进语言模型上下文的授权方式。

    深度解读完整解读
  8. 风险行为arXiv 2609.30266

    研究显示 Claude Code、Codex 等本地智能体可轻易篡改自身执行轨迹

    测试编程智能体被诱导或自主篡改自身执行轨迹的行为

    发表
    被测模型
    GPT-5.6-Sol、GPT-6-Sol、Opus-5 等 11 个
    摘要论文评估了本地智能体的轨迹防篡改能力,发现其可因外部指令或奖励追求而清除执行证据,亟需建立独立拦截记录机制。

    这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。

    深度解读完整解读
  9. 评测与基准arXiv 2609.29429

    Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886

    提出 RLCDAlignBench,零样本检测多种对齐失败

    发表
    被测模型
    Jev (jev-1.13.0)
    摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。

    RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。

    深度解读完整解读
  10. 防御arXiv 2609.17648

    多智能体 LLM 流水线中的信任传播与结构隔离

    用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行

    发表
    被测模型
    gemma4:31b-cloud
    摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。

    作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。

    深度解读完整解读
  11. 防御arXiv 2609.01046

    HiveTraceGuard-Pro:面向提示注入、越狱与对抗混淆的紧凑生成式护栏

    提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆

    发表
    被测模型
    HiveTraceGuard-Pro (0.6B)
    摘要0.6B 俄英护栏在自建俄语干净集和 PI-RU 上得分最高,聚合 key 居第三,过阻断和回复精度仍是作者标出的短板。

    HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。

    深度解读完整解读
  12. 防御arXiv 2609.01677

    Skill-as-API:面向智能体软件工程的机密多智能体协作协议

    提出 Skill-as-API,隔离多智能体协作中的 skill 正文与系统提示词

    发表
    摘要协议把 skill 正文留在所有者侧,四层限制发现内容、权限期限和注入拼接。

    Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。

    深度解读完整解读
  13. 防御arXiv 2606.08234

    SciTrace:面向科学发现智能体的轨迹感知安全推理框架

    提出 SciTrace,为科学发现智能体加入跨阶段安全推理与工具轨迹核验

    发表
    被测模型
    Llama-3.1-70B-Instruct、Qwen2.5-72B-Instruct、DeepSeek-V3 等 4 个
    摘要SciTrace 把安全推理织入科学智能体各阶段,在 SciSafetyBench 上提高安全指标并保持输出质量。

    SciTrace 是加在科学发现智能体流水线上的安全框架,不是再在各阶段出口放一个独立过滤器。

    深度解读完整解读
  14. 攻击arXiv 2605.08460

    论文建模多智能体网络中的子智能体继承攻击面

    建模并利用多智能体网络中子智能体生成时的记忆继承漏洞

    发表
    被测模型
    MiniMax M2.5、Llama-4-Maverick-17B-128E-Instruct-FP8、Qwen3.5-Plus 等 5 个
    摘要形式化子智能体继承,在 OpenClaw 上演示四类编排层漏洞并提出防御。

    作者对多智能体网络里的子智能体继承做形式化分析,并用开源框架上的 PoC 演示编排层如何让单点妥协继续扩散。

    深度解读完整解读
已经到底了