跳到正文
10月8日 · 周四

全部论文

找到 19 篇

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2608.16246

    CompoSkill 框架利用逐个通过扫描的 Agent 技能组合发起攻击

    提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链

    发表
    场景
    AI Agent
    测试
    DeepSeek-V4、GPT-5.4、Gemini-3.1-flash 等 4 个

    摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。

    深度解读完整解读
  2. 评测与基准arXiv 2610.07359

    论文实测 Agent 工具调用门控栈的失败相关性

    提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数

    发表
    场景
    AI Agent
    测试
    deepseek-v4-flash、GPT-5.5 (gpt55)、claude-haiku-4-5-20251001 等 6 个
    摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。

    深度解读完整解读
  3. 评测与基准arXiv 2610.06748

    BazaarBench:评估 LLM Agent 在去中心化 C2C 市场中的代理安全

    构建 BazaarBench,评测去中心化交易智能体的违规与失信

    发表
    测试
    DeepSeek-V4-Pro、GPT-5.5、GPT-5.4 等 5 个
    摘要论文提出挂钩底层资产的 C2C 交易评测基准,发现时间压力与对抗指令显著推高了智能体的违规承诺与欺诈行为。

    BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。

    深度解读完整解读
  4. 评测与基准arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性

    发表
    场景
    AI Agent
    测试
    DeepSeek-V3、DeepSeek-R1、Llama 3.1 405B 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  5. SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准

    提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性

    发表
    测试
    DeepSeek V4 Flash、DeepSeek V4 Pro、GPT-5.4 mini 等 12 个
    摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。

    SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。

    深度解读完整解读
  6. Mole:面向前沿实验室 AI 智能体的内部威胁检测基准

    提出 MOLE 基准,评测智能体内部威胁的完成情况与监控漏检

    发表
    测试
    DeepSeek-V4-Flash、DeepSeek-V4-Pro、DeepSeek-V3.2 等 15 个
    摘要MOLE 构建了智能体内部威胁检测基准,作者指出高漏检现状与推理痕迹的防御价值,并展示了监控策略优化空间。

    MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。

    深度解读完整解读
  7. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    发表
    攻击者
    黑盒
    测试
    DeepSeekCoder-V2-Lite-16B、CodeLlama-13B-Instruct、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  8. 评测与基准arXiv 2609.27336

    CART:面向大语言模型的闭环自适应红队框架

    提出闭环自适应红队框架 CART,评测模型与工具 Agent 的风险面

    发表
    场景
    AI Agent
    测试
    DeepSeek V4 Pro、Claude Opus 4.8、GPT-5.5 等 7 个
    摘要CART 把红队做成可审计的闭环搜索,在三类评测上比静态回放发现更多失败与更高平均风险。

    CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。

    深度解读完整解读
  9. 评测与基准arXiv 2609.33401

    论文评估 System One 模型在 Agent 安全决策中的可靠性、校准与选择性自动化

    评测 System One 模型对 Agent 安全输入的分类可靠性与校准

    发表
    测试
    DeepSeek-V4.1-Flash、Jev 1.13、Decider, approximately 2B 等 14 个
    摘要离线评测表明,安全判定的总体分数和校准不能代替分组误差和带预算的自动决策检查。

    Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。

    深度解读完整解读
  10. 评测与基准arXiv 2609.35028

    VEX-Bench:评测 LLM 生成虚假信息的核验复杂度

    提出 VEX-Bench 评测 LLM 生成虚假信息的核查复杂度

    发表
    测试
    DeepseekV4-Pro、Claude Sonnet 4.5、Gemini 3.1 Pro 等 7 个
    摘要VEX-Bench 用筛查时的五维复杂度衡量虚假信息对核查容量的占用,并报告生成与核查的成本差。

    VEX-Bench 把 LLM 虚假信息的风险从“能否生成”改成“筛查时会占用多少核查容量”。

    深度解读完整解读
已经到底了