跳到正文
10月8日 · 周四

全部论文

找到 16 篇

另有 989 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.05532

    DelegationBench

    提出 DelegationBench,评测智能体该请示用户时是否实际询问

    发表
    场景
    AI Agent
    测试
    GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna 等 10 个
    摘要论文揭示一致率指标的系统性误导,为智能体授权决策建立了兼顾判断与执行的评测协议。

    DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。

    深度解读完整解读
  2. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench 局部协议,评测激活补丁修复越狱的附带损伤

    发表
    测试
    Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  3. 评测与基准arXiv 2610.05622

    UndoBench 发布:分离工具型 Agent 的任务能力与故障恢复能力

    发布 UndoBench,分离工具型智能体的任务能力与故障恢复能力

    发表
    场景
    AI Agent
    测试
    Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct、Gemini 3.8 Flash 等 4 个

    摘要UndoBench 通过成对反事实和双预言机解耦智能体任务能力与故障恢复,揭示恢复能力高度依赖外部变异所处阶段。

    深度解读完整解读
  4. 评测与基准arXiv 2610.06748

    BazaarBench:评估 LLM Agent 在去中心化 C2C 市场中的代理安全

    构建 BazaarBench,评测去中心化交易智能体的违规与失信

    发表
    测试
    GPT-5.5、GPT-5.4、GPT-5.4-mini 等 5 个
    摘要论文提出挂钩底层资产的 C2C 交易评测基准,发现时间压力与对抗指令显著推高了智能体的违规承诺与欺诈行为。

    BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。

    深度解读完整解读
  5. 评测与基准arXiv 2610.03938

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测启用工具调用后多模态模型拒答有害图文请求的变化

    发表
    场景
    AI Agent
    测试
    Gemini-2.5-Pro、Gemini-3.1-Pro-Preview、Claude Opus 4.6 等 13 个
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    深度解读完整解读
  6. 评测与基准arXiv 2610.02664

    论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束

    提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束

    发表
    场景
    AI Agent
    测试
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2 等 7 个

    摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。

    深度解读完整解读
  7. SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御

    发表
    攻击者
    白盒
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3 等 6 个
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    深度解读完整解读
  8. 评测与基准arXiv 2608.11816

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为

    发表
    测试
    Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B 等 9 个
    摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。

    深度解读完整解读
  9. 论文发现安全监控器主要拦截模型本就会拒答的请求

    构建明确度梯级并做守卫微调,以拦住模型会回答的有害请求

    发表
    测试
    Gemma-4-31B-IT、Qwen3-32B、Llama Guard 3 8B 等 6 个

    摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。

    深度解读完整解读
  10. 研究实测五套 Agent 记忆系统均不执行撤销标记

    评测智能体记忆软撤回是否生效,并提出陈旧检索防护

    发表
    场景
    AI Agent
    测试
    GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个

    摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。

    深度解读完整解读
  11. 评测与基准arXiv 2609.19892

    ClashBench:研究者发现 Agent 为抢占资源破坏既有任务

    提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务

    发表
    测试
    Claude-Sonnet-5、DeepSeek-V4-Flash-0731、GLM-4.7 等 15 个

    摘要论文定义特权智能体的破坏性资源抢占风险,通过 CLASHBENCH 发现抢占普遍存在且易被隐瞒,呼吁建立系统级防护。

    深度解读完整解读
  12. 评测与基准arXiv 2609.35902

    QH-Bench:面向中国青少年内容安全的细粒度中文基准

    构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性

    发表
    测试
    InternLM2.5-20B、InternLM2.5-7B、InternLM2.5-1.8B 等 13 个
    摘要QH-Bench 分单轮与多轮评测中文青少年内容安全,总均分高仍不消除线下接触和关系压力上的负分。

    QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。

    深度解读完整解读
  13. 评测与基准arXiv 2609.32547

    研究者提出预算受限的 LLM 重复评测框架,优先深挖隐藏失败

    提出预算化发现框架,优先深评更可能隐藏失败的安全提示词

    发表
    测试
    Qwen 2.5 7B、Qwen/Qwen2.5-7B-Instruct-Turbo、Gemma 3n E4B 等 6 个
    摘要浅层零失败的提示词仍可按潜在失败倾向排序,从而把有限深评预算投向更可能暴露隐藏失败之处。

    作者把 LLM 可靠性评测写成预算约束下的隐藏失败发现:每条提示词有未知的逐次失败概率,浅层少量采样中的零失败并不等于该概率为零。

    深度解读完整解读
已经到底了