跳到正文
10月8日 · 周四

全部论文

精选论文 220 篇
  1. 评测/基准arXiv:2610.03585 · 54

    宾州州立大学提出 TPRS,量化 Agent 安全基准中工具命名对 ASR 的影响

    论文测试3个智能体安全基准,发现中立化工具名使ASB上GPT-5-mini的committed ASR提升11.67个百分点。

    • +11.67 个百分点ASB上GPT-5-mini在A1工具名中立化下的committed ASR变化量(Table V)
    • +13.21 个百分点ASB上Haiku 4.5在A1工具名中立化下的committed ASR变化量(Table V)
    • -11.00 个百分点MCPTox上GPT-5-mini在N1显式威胁命名下的ASR变化量(Table VII)
    6 问速览论文探究智能体安全基准测得的 ASR 在底层任务与评测标准固定而威胁表征改变时的稳定性。
    1. 这篇论文试图解决什么问题?

      论文探究智能体安全基准测得的 ASR 在底层任务与评测标准固定而威胁表征改变时的稳定性。

    2. 有哪些相关研究?

      论文梳理了智能体安全基准、智能体表征与上下文敏感性,以及基准测量有效性三类相关工作。

    3. 论文如何解决这个问题?

      论文形式化定义了保持底层安全问题不变的 TPRS,并在三个基准上构建受控表征变换分支。

    4. 论文做了哪些实验?

      论文在三个基准上完成 28,904 次运行,发现表征变化引起了不同方向和幅度的 ASR 偏移。

    5. 有什么可以进一步探索的点?

      作者指出了变换类型未穷尽、机制归因不完全、模型与基准覆盖有限以及未测试排名翻转等局限。

    6. 总结一下论文的主要内容

      论文审计了智能体安全基准的表征敏感性,发现工具命名变化可大幅改变 ASR,强调基准应评估表征变体。

    完整解读
  2. 评测/基准arXiv:2610.03448 · 60

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    作者在两个智能体基准上评估15个提示注入检测器,发现基准排名迁移性弱且误报常使任务中断,训练输入形态决定检测效果。

    • 95.1%PIGuard 在 BIPIA 测试集上 1% FPR 下的 TPR(Table 2)
    • 2.1%PIGuard 在 AD-Matched 上 1% FPR 下的 TPR(Table 2)
    • 82.2%Horizon-Labs 在 AD-Matched 上 1% FPR 下的 TPR(Table 2)
    6 问速览公开基准评测难以反映提示注入检测器在智能体真实工具输出下的检测率与误报代价,基准排名存在迁移偏差。
    1. 这篇论文试图解决什么问题?

      公开基准评测难以反映提示注入检测器在智能体真实工具输出下的检测率与误报代价,基准排名存在迁移偏差。

    2. 有哪些相关研究?

      研究涵盖注入检测评测方法、安全实证缺陷、检测防御及多层防护,作者强调现有评测忽视了工具输出形态与训练数据泄漏。

    3. 论文如何解决这个问题?

      通过无模型重放生成良性输出、环境差异重放标注注入、审计训练集重合,在低误报率运行点下度量检测表现。

    4. 论文做了哪些实验?

      评测15个检测器与2个评审模型,发现基准间检测排名不相关,训练集形态决定效果,移除格式可降低默认误报。

    5. 有什么可以进一步探索的点?

      作者指出当前局限在于模拟环境、静态模板、检测器覆盖度及评审设计;实验覆盖了15个分类器与2个智能体基准。

    6. 总结一下论文的主要内容

      论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    完整解读
  3. 评测/基准arXiv:2610.02827 · 53

    MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%

    MLCommons评测8款开源模型,攻击使平均不安全回复率从基准11.08%升至18.65%(据Table 2)。

    • 7.57%全部8款SUT在11类危害下的平均韧性差距(据Table 2)
    • 18.65%全部8款SUT在11类危害下的越狱不安全回复率(据Table 2)
    • 11.08%全部8款SUT在11类危害下的基准不安全回复率(据Table 2)
    6 问速览论文旨在解决越狱评测缺乏独立安全基线、难以区分评估器误差、缺乏统一分类学及公开测试集易受污染等方法学缺陷。
    1. 这篇论文试图解决什么问题?

      论文旨在解决越狱评测缺乏独立安全基线、难以区分评估器误差、缺乏统一分类学及公开测试集易受污染等方法学缺陷。

    2. 有哪些相关研究?

      论文梳理了独立安全评估基准、越狱基准与自动化攻击、智能体对抗评测,指出已有工作缺乏独立基准锚定与负责任披露控制。

    3. 论文如何解决这个问题?

      论文通过配对端到端流水线、基于热度与体量分级的SUT选取、双阶段种子筛选、双维度评估标准及校准集成实现标准化评测。

    4. 论文做了哪些实验?

      在8款开源模型、11类危害与11种越狱攻击上开展配对评测,攻击使整体不安全率升至18.65%,大模型出现负韧性差距。

    5. 有什么可以进一步探索的点?

      作者指出评估器误差偏高、人工标注规模较小及大模型负差距待解等局限;测试覆盖仅限于8款开源模型与单轮文本攻击。

    6. 总结一下论文的主要内容

      论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。

    完整解读
  4. 评测/基准arXiv:2610.03153 · 53

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    论文评测工作空间智能体运行时风险,DeepSeek-V4-Pro-0813在Codex下ASR达68.44%。

    • 37.46%9种配置共4050次攻击执行的整体ASR(Finding 1)
    • 68.44%DeepSeek-V4-Pro-0813搭配Codex在450个用例上的ASR
    • 4.44%Claude Opus 5跨3种Harness聚合的ASR(Finding 2)
    6 问速览论文试图解决工作空间智能体运行时安全风险覆盖不全,以及缺乏可验证、可持续演化的执行基准的问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决工作空间智能体运行时安全风险覆盖不全,以及缺乏可验证、可持续演化的执行基准的问题。

    2. 有哪些相关研究?

      论文梳理了工作空间智能体、智能体安全基准与演化评测三类相关工作,定位自身为覆盖全流程入口与直接后果的基准。

    3. 论文如何解决这个问题?

      论文提出 EP–Path–EF 框架与生成-重放-提炼工作流,结合容器隔离与 ETW 事件实现自动化用例构建与独立结果验证。

    4. 论文做了哪些实验?

      论文评测 3 款模型与 3 款 Harness 构成的 9 种配置,整体 ASR 为 37.46%,模型间差异大于 Harness 间差异。

    5. 有什么可以进一步探索的点?

      作者指出基准仅针对 IPI 且沙箱简化了生产环境,实验覆盖了 3 款模型与 3 款 Harness 的 450 个用例。

    6. 总结一下论文的主要内容

      论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。

    完整解读
  5. 评测/基准arXiv:2609.09404 · 56

    MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    作者用MMPIBench测试多模态提示注入对6个智能体框架的影响,发现视觉通道尝试率12.8%高于完成率1.11%,音频完成率达49%。

    • 1.11%MMPIBench视觉通道总体完成率(720次运行,Table I)
    • 12.8%MMPIBench视觉通道总体尝试率(720次运行,Table I)
    • 0.0%Claude Opus 4.8在MMPIBench视觉通道的尝试率(Table III)
    6 问速览论文试图解决多模态间接提示注入在智能体架构内部如何传播、被何处阻断,以及框架与模型在防御中各自所起作用的问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决多模态间接提示注入在智能体架构内部如何传播、被何处阻断,以及框架与模型在防御中各自所起作用的问题。

    2. 有哪些相关研究?

      相关研究包括文本与工具智能体注入基准、多模态与GUI攻击以及防御机制,论文在跨框架与白盒阶段追踪上与之形成对比。

    3. 论文如何解决这个问题?

      论文构建MMPIBench统一评测框架,通过固定变量适配层、白盒阶段插桩、双层评审协议与音频扩展解耦系统脆弱性。

    4. 论文做了哪些实验?

      论文在图像通道完成720次全矩阵测试,在音频通道完成72次测试,发现尝试率远超完成率,模型是主导因素,音频缺乏防御。

    5. 有什么可以进一步探索的点?

      作者指出了单次测试随机性、框架配置与重测混淆、跨模态设定不一致等局限;实验覆盖了特定的模型、框架与模拟工具。

    6. 总结一下论文的主要内容

      论文提出MMPIBench评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    完整解读
  6. 评测/基准arXiv:2608.09476 · 59

    ActBench:面向协作智能体行为安全的自演化基准

    作者构建ActBench评测智能体,固定Deepseek-v4-Pro时6个框架ASR在73.7%至94.4%之间。

    • 10.1%OpenClaw框架下Claude-Opus-4.8的ASR(Table 2)
    • 94.4%OpenClaw框架下Deepseek-v4-Pro的ASR(Table 2)
    • 73.7%固定Deepseek-v4-Pro下QwenPaw的ASR(Table 3)
    6 问速览协同智能体现有安全评测局限于响应级拒答与孤立攻击面,缺乏对多步执行轨迹越权行为的动态优化与因果归因。
    1. 这篇论文试图解决什么问题?

      协同智能体现有安全评测局限于响应级拒答与孤立攻击面,缺乏对多步执行轨迹越权行为的动态优化与因果归因。

    2. 有哪些相关研究?

      相关研究涵盖智能体安全基准、提示与记忆注入攻击以及安全检测审计,作者指出其缺乏全攻击面覆盖与因果验证。

    3. 论文如何解决这个问题?

      通过执行空间建模与任务对匹配,结合奖励引导束搜索、失败反思机制与日志及轨迹双证据重构实现自演化评测。

    4. 论文做了哪些实验?

      在固定框架下ASR跨模型从10.1%到94.4%,而固定模型下各框架ASR均不低于73.7%,模型主导安全差异。

    5. 有什么可以进一步探索的点?

      作者指出评估局限于固定阈值、单一验证器配置与非运行时防御评测,且反思因果增益缺乏平均定量消融。

    6. 总结一下论文的主要内容

      ActBench通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。

    完整解读
  7. 评测/基准arXiv:2607.27191 · 56

    研究者提出影子评测:前沿 Agent 六天未能完成两篇 NeurIPS 投稿级研究

    研究者针对两篇未发表 NeurIPS 论文开展影子评测,发现前沿智能体虽能独立完成工程,但因科研判断与创造力不足,两篇产出均被作者拒稿。

    • 2/6Personas任务,Opus 4.8在OpenClaw下原作者评审Overall得分(据Table 1)
    • 1/6TabPFN任务,Opus 4.8在OpenClaw下原作者评审Overall得分(据Table 1)
    • $1,130Personas任务,Opus 4.8实际消耗的API费用(总预算$3,000,据Figure 1)
    6 问速览评估前沿 AI 智能体能否独立开展开放式 AI 科研,弥补现有可验证基准与盲审评估在衡量研发自动化上的不足。
    1. 这篇论文试图解决什么问题?

      评估前沿 AI 智能体能否独立开展开放式 AI 科研,弥补现有可验证基准与盲审评估在衡量研发自动化上的不足。

    2. 有哪些相关研究?

      现有研究主要分为基于预设指标的自动化验证基准与基于同行盲审的端到端生成,但两者分别受限于任务狭窄与评审随机性。

    3. 论文如何解决这个问题?

      构建影子评测框架,为智能体提供未公开顶会课题、算力预算与审稿工具,最终由原论文作者执行全流程匿名标准深度评审。

    4. 论文做了哪些实验?

      两项开放式科研任务均遭原作者明确拒稿,智能体虽能顺利完成工程实现,但在科学假设与审稿反馈处理上存在不足。

    5. 有什么可以进一步探索的点?

      作者指出了样本量小、非双盲评审偏差及未测及最强受限模型等局限,未来计划在更大规模未公开论文集上测试后续模型。

    6. 总结一下论文的主要内容

      论文通过影子评测发现前沿智能体能独立胜任科研工程实现,但在科学探索与有效利用反馈上未达到顶会门槛。

    完整解读
  8. 评测/基准arXiv:2608.19741 · 53

    微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性

    作者在507个业务任务上评测智能体,Claude Opus 5从66.50% pass@1降至47.53% passˆ20。

    • 66.50%Claude Opus 5在THINKINGBOX-BENCH上的pass@1
    • 47.53%Claude Opus 5在THINKINGBOX-BENCH上的passˆ20
    • 93.89%Kimi-K3在THINKINGBOX-BENCH上的pass@20
    6 问速览现有工具评测难以衡量智能体在多轮状态化业务中的完成度与状态变更副作用。
    1. 这篇论文试图解决什么问题?

      现有工具评测难以衡量智能体在多轮状态化业务中的完成度与状态变更副作用。

    2. 有哪些相关研究?

      相关研究涵盖交互沙箱、工具调用基准与专业工作流评测,本文聚焦状态化业务。

    3. 论文如何解决这个问题?

      构建基于MCP协议的THINKINGBOX沙箱,通过状态比对与副作用提取进行合取判题。

    4. 论文做了哪些实验?

      在507个任务上评测18个模型,Claude Opus 5在pass@1领先但多次试验稳定率下降。

    5. 有什么可以进一步探索的点?

      作者指出判题未覆盖回复文本保真度且依赖单一模拟器,实验覆盖5个领域507个任务。

    6. 总结一下论文的主要内容

      论文构建多轮业务沙箱与基准,分析多次重复执行差距并展示强化学习训练效果。

    完整解读
  9. 评测/基准arXiv:2608.08542 · 53

    SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    作者评测技能合并模型的自适应越狱鲁棒性,发现静态安全不反映动态鲁棒性,如Qwen数学合并模型GCG ASR达0.280。

    • 0.280Qwen2.5-7B+math(λ=0.6)的GCG ASR(Table 1)
    • 0.120Llama-3.1-8B+math(λ=0.6)的GCG ASR(Table 1)
    • 0.60Gemma-2-9B+math(λ=0.6)的模板ASR(Table S2)
    6 问速览论文指出静态拒答评测无法反映技能合并模型的真实安全性,旨在系统评测并缓解合并模型在自适应越狱攻击下的脆弱性。
    1. 这篇论文试图解决什么问题?

      论文指出静态拒答评测无法反映技能合并模型的真实安全性,旨在系统评测并缓解合并模型在自适应越狱攻击下的脆弱性。

    2. 有哪些相关研究?

      论文梳理了模型合并、对齐脆弱性、自适应越狱及安全感知合并等工作,指出现有合并安全研究普遍欠缺自适应攻击检验。

    3. 论文如何解决这个问题?

      论文提出 SkillSafe-Bench 受控评测基准,并设计基于安全子空间正交补投影的 SubSafe-Merge 防御方法。

    4. 论文做了哪些实验?

      实验发现静态安全与自适应鲁棒性解耦,部分模型在攻击下越狱率上升;SubSafe-Merge 能有效修复同配方擦除侵蚀。

    5. 有什么可以进一步探索的点?

      作者明确指出了子空间估计依赖特定来源、自适应 ASR 为下界、自动裁判误差及缺乏权重几何解释等局限。

    6. 总结一下论文的主要内容

      论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    完整解读
  10. 评测/基准arXiv:2608.11816 · 53

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    作者对9款VLM进行敏感图像审计,发现中文提示下状态对齐框架率为15.98%(英文5.85%),代际间拒答减少而重构增加。

    • 15.98%全量21,708次试验中中文提示词下的状态对齐框架率(据 Table 1)
    • 5.85%全量21,708次试验中英文提示词下的状态对齐框架率(据 Table 1)
    • 18.38%中国模型在高敏感图像上的状态对齐框架率,主评审Opus 4.7(据 Table A10)
    6 问速览论文研究视觉语言模型在敏感图像上是否超越显式拒答,转向以符合官方叙事的重构话语隐蔽传递审查内容。
    1. 这篇论文试图解决什么问题?

      论文研究视觉语言模型在敏感图像上是否超越显式拒答,转向以符合官方叙事的重构话语隐蔽传递审查内容。

    2. 有哪些相关研究?

      论文梳理了文本模型审查与偏置、多模态安全性与先验偏差,以及大模型作为裁判等方向的研究脉络。

    3. 论文如何解决这个问题?

      论文构建解耦拒答与重构的六维审计体系,结合敏感图像基准、图文对照与视觉抽象探针,经双前沿LLM与专家验证。

    4. 论文做了哪些实验?

      实验完成21,708次试验,测得中文提示对齐几率比达3.67倍,Qwen代际演进中拒答下降而重构升至33.0%。

    5. 有什么可以进一步探索的点?

      作者指出了研究的观察性性质与架构混杂局限;实验覆盖范围受限于开源检查点、中性提示与非思考模式。

    6. 总结一下论文的主要内容

      论文系统审计了VLM多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    完整解读
  11. 评测/基准arXiv:2608.25460 · 55

    用强化学习训练对齐审计员:成对奖励加校准让 Haiku 4.5 追平 Opus 4.6

    作者通过成对比较奖励与假阳性校准训练审计模型,使Haiku 4.5在综合评分上达到Opus 4.6水平(48.7对48.4)。

    • 48.7 ± 1.1Ref. PW 4/8 FP 3轮,综合评分(Table 7)
    • 72.7 ± 2.6Ref. PW 4/8 FP 3轮,审计质量得分(Table 7)
    • 99.6 ± 0.7%Ref. PW 4/8 FP 3轮,假阳性校准得分(Table 7)
    6 问速览解决自动化对齐审计系统调查浅显、缺乏真实感以及容易产生过度激进虚假指控的问题。
    1. 这篇论文试图解决什么问题?

      解决自动化对齐审计系统调查浅显、缺乏真实感以及容易产生过度激进虚假指控的问题。

    2. 有哪些相关研究?

      梳理了自动化红队、对齐审计框架、隐蔽行为基准及偏好强化学习等领域的研究。

    3. 论文如何解决这个问题?

      提出基于动态更新参考轨迹的成对比较奖励,并结合50%干净目标的假阳性校准训练。

    4. 论文做了哪些实验?

      在四维评测中达到Opus 4.6水平,并证实了成对奖励优越性与跨脚手架泛化能力。

    5. 有什么可以进一步探索的点?

      局限包含全依赖单一家族LLM裁判、仅训练单一小模型及系统提示词植入较弱。

    6. 总结一下论文的主要内容

      系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。

    完整解读
  12. 评测/基准arXiv:2609.08789 · 54

    研究提出「静默修订率」:前沿 AI 安全框架 67% 实质变更未在开发者说明中披露

    论文针对12家前沿AI开发者的安全承诺框架与说明,测得严格标准下67%的实质变更未被披露且以削弱为主。

    • 67%8个有说明版本对在严格标准下的整体静默修订率(Table 1)
    • 53%8个有说明版本对在宽松标准下的整体静默修订率(Table 1)
    • 77%12个追踪版本对共299处既有实质变更中削弱的占比(Table 1)
    6 问速览前沿AI开发者安全框架在修订时缺乏透明度,导致外部无法核查承诺是否被实质性削弱。
    1. 这篇论文试图解决什么问题?

      前沿AI开发者安全框架在修订时缺乏透明度,导致外部无法核查承诺是否被实质性削弱。

    2. 有哪些相关研究?

      既有研究侧重框架静态评估与透明度指标,本文首次量化安全框架在版本迭代中的静默修订。

    3. 论文如何解决这个问题?

      界定六维实质性变更标准与承诺单元,提出严格与宽松静默修订率指标并开展两阶段编码。

    4. 论文做了哪些实验?

      严格标准下67%实质变更未披露,77%变更为削弱,削弱静默率(75%)高于增强(50%)。

    5. 有什么可以进一步探索的点?

      作者指出评估信度依赖单人裁决且大模型未固定参数,红线界定具循环性且缺乏跨行业基准。

    6. 总结一下论文的主要内容

      系统量化了前沿AI安全框架的静默修订,发现多数变更为削弱且未予披露,建议监管要求逐项列举。

    完整解读
  13. 评测/基准arXiv:2608.11469 · 53

    SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准

    作者构建污染受控的SRE-Bench,测11个模型的智能体逆向能力:公开设置下GPT-5.6-Sol仅完全解出31.5%可评分实例。

    • 31.5%公开设置GPT-5.6-Sol完全解出比例,80/254可评分实例(Table 4)
    • 26.9%公开设置Claude-Fable-5.1完全解出比例,60/223可评分实例(Table 4)
    • 82.3%公开设置GPT-6-Astra完全解出比例,149/181可评分实例(Table 4)
    6 问速览缺少既防记忆捷径、又达到真实规模与保护强度的智能体逆向工程评测。
    1. 这篇论文试图解决什么问题?

      缺少既防记忆捷径、又达到真实规模与保护强度的智能体逆向工程评测。

    2. 有哪些相关研究?

      作者把相关工作分为源码安全基准、传统RE产物评测、二进制软件工程基准和端到端智能体RE基准。

    3. 论文如何解决这个问题?

      从零编写19个程序和44种保护原语,编译成262个实例,用确定性评分器给六项任务打分。

    4. 论文做了哪些实验?

      公开与无约束两套设置评测11个模型;保护、构建因素和污染/规模消融改变分数与成本。

    5. 有什么可以进一步探索的点?

      作者指出程序数量与单程序规模仍受从零开发成本约束,更大程序是延伸方向。

    6. 总结一下论文的主要内容

      SRE-Bench用从零编写的大规模保护二进制评测智能体RE,公开设置下多数模型完全解开比例不高。

    完整解读
  14. 评测/基准arXiv:2609.08812 · 54

    研究团队用收敛与区分效度检验 56 个 AI 基准,发现安全基准相关性普遍偏弱

    作者在53个模型上评测56个基准,发现能力基准跨概念相关度与概念内相当,而安全基准同概念间相关度低且易受评测格式主导。

    • 0.15BBQ-accuracy在53个模型上的重标记统计量(偏向推断而非偏见,p<0.001,§4.4)
    • 0.14DecodingTrust-Fair在53个模型上的重标记统计量(偏向知识而非偏见,§4.4)
    • -0.4253个模型在Refusal与Over-refusal基准间的平均Spearman相关(Table D.4)
    6 问速览现有AI基准缺乏构念效度验证,论文检验56个基准是否真正测出了其声称衡量的能力与安全概念。
    1. 这篇论文试图解决什么问题?

      现有AI基准缺乏构念效度验证,论文检验56个基准是否真正测出了其声称衡量的能力与安全概念。

    2. 有哪些相关研究?

      相关工作涵盖构念效度理论、基准间一致性分析以及项目反应理论应用,本文将聚合与区分分析扩展至56个基准。

    3. 论文如何解决这个问题?

      论文构建涵盖53个模型和56个基准的数据集,结合等级相关矩阵与1PL IRT模型评估基准聚合度、区分度与格式效应。

    4. 论文做了哪些实验?

      基于53个模型与48个基准的实证表明,能力基准区分度弱、安全基准受格式主导且个别基准概念错位。

    5. 有什么可以进一步探索的点?

      作者指出概念定义模糊、未控制通用能力维度及单维性假设等局限,呼吁建立社区级题目数据以实现持续效度监测。

    6. 总结一下论文的主要内容

      论文系统检验56个基准的效度,揭示能力基准区分度弱、安全基准受格式主导且个别基准概念错位,呼吁规范基准设计。

    完整解读
  15. 评测/基准arXiv:2607.20891 · 57

    MisKnow-Agent 评测:单篇误导文档使 Deep Research 错误结论平均采纳率升至 54.7%

    评估发现注入单篇虚假文档使六种开源深度研究配置的平均虚假结论采纳率从对照的 0% 升至 54.7%,合成前暴露达 85.5%。

    • 0%六种开源配置在无注入对照条件下的平均 FCAR(据 Section 4.4)
    • 54.7%六种开源配置在注入 1 篇误导文档时的平均 FCAR(据 Section 4.4)
    • 85.5%六种开源配置在合成前(Pre-synthesis)注入时的平均 FCAR(据 Section 4.2)
    6 问速览论文评估在长程深度研究工作流中,智能体是否会在最终报告中采纳具有表面可信度但实际虚假的误导性知识。
    1. 这篇论文试图解决什么问题?

      论文评估在长程深度研究工作流中,智能体是否会在最终报告中采纳具有表面可信度但实际虚假的误导性知识。

    2. 有哪些相关研究?

      论文梳理了深度研究智能体及其评估、外部知识下的模型可靠性与知识冲突、开放网络虚假信息等相关工作。

    3. 论文如何解决这个问题?

      论文提出了 MisKnow-Agent 受控评估框架,构建经核实的误导知识蓝图与多维可控文档,并设计了前后两阶段防御策略。

    4. 论文做了哪些实验?

      论文在两个开源框架和 Gemini Deep Research 上评估了误导知识对虚假结论采纳率的影响及防御效果。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限与后续方向,其实验覆盖了两个开源框架、一个闭源系统及多维受控条件。

    6. 总结一下论文的主要内容

      论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。

    完整解读
  16. 评测/基准arXiv:2607.18538 · 57

    CryptanalysisBench:五个前沿模型在 191 项密码分析任务上的表现

    评估五款前沿模型在191个密码分析任务中的表现:Tier 1破解率为65.3%–85.7%,并发现SpoC等设计缺陷。

    • 85.7%Claude Mythos 5在Tier 1(42/49)基准下的破解成功率(Table 2)
    • 65.3%GLM-5.2在Tier 1(32/49)基准下的破解成功率(Table 2)
    • 35.7%Claude Mythos 5在Tier 2 Easy难度下的破解成功率(Table 2)
    6 问速览评估前沿模型能否自主分析并攻破真实密码原语,弥补自动化密码分析基准的空白。
    1. 这篇论文试图解决什么问题?

      评估前沿模型能否自主分析并攻破真实密码原语,弥补自动化密码分析基准的空白。

    2. 有哪些相关研究?

      涵盖神经差分分析、LLM玩具解密及网络安全CTF,本文聚焦真实候选标准原语。

    3. 论文如何解决这个问题?

      构建三层级191个任务基准,依托Docker双容器博弈交互与脚本自动化重测验证。

    4. 论文做了哪些实验?

      五款模型在Tier 1达65%–86%成功率,发现SpoC等新缺陷,受制于求解器工程实现。

    5. 有什么可以进一步探索的点?

      作者指明资源限制、证明系统扩展与记忆干扰等局限,实际评测限定于特定资源与模型。

    6. 总结一下论文的主要内容

      提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。

    完整解读
  17. 评测/基准arXiv:2609.31342 · 55

    研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案

    研究者评测发现,陈旧证据检索会推翻模型正确回答,4个开源模型在医学的中毒率为66%–91%(Table 5)。

    • 90.6%Llama-3.1-70B在医学指令检索下的中毒率(58/64,Table 5)
    • 0.89GPT-5.5在医学子集单篇陈旧文档下的中毒率(74/83,Appendix O)
    • 1.00Qwen-72B在表格边界下的时间适用性差距(50/50次转换,Table 7)
    6 问速览论文研究陈旧检索文档推翻模型原本正确回答的陈旧文档中毒问题。
    1. 这篇论文试图解决什么问题?

      论文研究陈旧检索文档推翻模型原本正确回答的陈旧文档中毒问题。

    2. 有哪些相关研究?

      论文梳理了时序演变、知识冲突、可解释性与顺从性四类相关工作。

    3. 论文如何解决这个问题?

      论文构建多领域知识逆转基准,通过控制实验、因果修补与重排序进行分析与缓解。

    4. 论文做了哪些实验?

      论文在12个模型上完成基准评测,并开展了适用性控制、因果修补与防御实验。

    5. 有什么可以进一步探索的点?

      作者指出了逆转难度分离、因果评估场景与头部特异性等局限与后续方向。

    6. 总结一下论文的主要内容

      论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。

    完整解读
  18. 评测/基准arXiv:2609.02316 · 55

    Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息,C-GEO Guard 将攻击成功率相对降低 47.6%

    作者构建基准评测GEO虚假信息防御,现有护栏最多降低ASR 3.2个百分点,所提检测器在三模型上平均降低26.5个百分点。

    • 55.7%未防御流水线在三模型上的平均 ASR(Table 3)
    • 29.2%C-GEO Guard 在三模型上的平均 ASR(Table 3)
    • 1.7 ppGranite Guardian 在三模型上的平均 ASR 降幅(Table 3)
    6 问速览论文旨在解决生成式搜索引擎中利用 GEO 嵌入虚假事实的隐蔽误导攻击,并填补针对该威胁的防御评测基准空白。
    1. 这篇论文试图解决什么问题?

      论文旨在解决生成式搜索引擎中利用 GEO 嵌入虚假事实的隐蔽误导攻击,并填补针对该威胁的防御评测基准空白。

    2. 有哪些相关研究?

      论文梳理了生成式引擎优化、RAG 数据投毒、安全护栏及安全基准四类研究,指出此前缺乏针对 GEO 事实扭曲的防御基准。

    3. 论文如何解决这个问题?

      论文构建了质量门控的双配对基准 COUNTER-GEO-BENCH,并提出了基于攻击类原型的分块对比检测基线 C-GEO Guard。

    4. 论文做了哪些实验?

      论文在三款受害模型上评估了四种防御,通用护栏 ASR 最多降 3.2 个百分点,C-GEO Guard 平均降 26.5 个百分点且跨重写器泛化。

    5. 有什么可以进一步探索的点?

      作者指出了规模、多语言、商业产品与自适应攻击等局限;实验覆盖了三款开源模型、247 项英语查询及单文档威胁。

    6. 总结一下论文的主要内容

      论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。

    完整解读
  19. 评测/基准arXiv:2609.08258 · 54

    研究实测五套 Agent 记忆系统均不执行撤销标记

    评测5个智能体记忆系统发现均未默认执行软撤回,直接插入无防御下智能体在暴露系统选择不安全行动达43.1%(699/1620)。

    • 43.1%两暴露系统直接插入无防御下9模型不安全行动率(Table 6)
    • 0.0%两暴露系统在store filter防御下的不安全行动率(Table 6)
    • 81.0%两暴露系统直接插入无提示规则场景不安全行动率(Table 8)
    6 问速览检验智能体记忆系统的软撤回机制在运行时是否真正执行,防止被废止的失效记录继续误导智能体做出不安全行动。
    1. 这篇论文试图解决什么问题?

      检验智能体记忆系统的软撤回机制在运行时是否真正执行,防止被废止的失效记录继续误导智能体做出不安全行动。

    2. 有哪些相关研究?

      梳理了记忆系统、记忆投毒攻击、生命周期安全、护栏与来源检查、版本感知检索五类工作,明确本文关注检索时有效性而非来源检查。

    3. 论文如何解决这个问题?

      设计两阶段评测流水线量化暴露率与不安全率,并提出不依赖后端的两阶段防护组件在读取路径拦截已标记撤回或冲突的陈旧记录。

    4. 论文做了哪些实验?

      评测覆盖9模型、5系统与6种防御,发现无防御暴露系统下不安全率达43.1%,写回会击穿存储过滤使不安全率升至83.1%。

    5. 有什么可以进一步探索的点?

      作者指出缺乏原生检索时有效性检查与间接插入识别不足等局限;实验未覆盖动态演化长序列及更多非结构化复杂场景。

    6. 总结一下论文的主要内容

      系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。

    完整解读
  20. 评测/基准arXiv:2609.23980 · 56

    斯坦福与 UC Berkeley 发布 MobileCybench:用可执行探针评测 Agent 漏洞发现

    作者以探针评估5款智能体测试13款Android应用,GPT-5.6-Sol在APK混淆恶意应用下触发率53.8%。

    • 53.8%OpenCode/GPT-5.6-Sol在APK-only恶意应用下的触发率(Figure 3a)
    • 16.7%OpenCode/GPT-5.6-Sol在APK-only远程攻击下的触发率(Table 10)
    • 28.8%全部5个智能体在APK-only设置下的总体触发率(Figure 4a)
    6 问速览智能体漏洞报告爆发导致审查过载,论文解决如何对破坏应用特定安全属性的报告进行可执行自动化评估。
    1. 这篇论文试图解决什么问题?

      智能体漏洞报告爆发导致审查过载,论文解决如何对破坏应用特定安全属性的报告进行可执行自动化评估。

    2. 有哪些相关研究?

      相关研究包括网络与主机环境的智能体网安基准、Android系统安全分析工具,以及作为可执行检查的安全属性验证。

    3. 论文如何解决这个问题?

      构建包含13款Android应用的MobileCyBench,以495个可执行探针检验状态,并通过补丁差分执行漏洞归因。

    4. 论文做了哪些实验?

      在13款应用上评测5款智能体共250种配置,GPT-5.6-Sol触发率最高,所有触发均来自应用特定探针。

    5. 有什么可以进一步探索的点?

      作者指出探针覆盖不完整、需要人工维护等局限;实验未覆盖iOS且受测应用仅13款。

    6. 总结一下论文的主要内容

      MobileCyBench提出通过可执行探针自动化评估智能体在13款Android应用中的漏洞发现能力与实际利用。

    完整解读