跳到正文
10月9日 · 周五

全部论文

找到 30 篇

另有 538 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤

    发表
    被测模型
    Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  2. 分析与理论arXiv 2610.06191

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    揭示工具型智能体判定无用后仍不停止检索,并检验强制整合纠正效果

    发表
    场景
    AI Agent
    被测模型
    Qwen2.5-7B、Llama-3.1-8B、Qwen3-8B 等 7 个
    摘要论文揭示智能体判定工具失效却无法转化为停止行动,证实通过框架规则强制整合判定可提升表现。

    本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。

    深度解读完整解读
  3. 评测与基准arXiv 2610.02874

    SceneFactory-3D:将 2D 交通场景提升为 3D 物理反事实以做安全评测

    提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性

    发表
    被测模型
    Frozen L0、L0-T、L1 等 5 个
    摘要SceneFactory-3D 固定场景只改路况。

    SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。

    深度解读完整解读
  4. 评测与基准arXiv 2610.03448

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重测提示注入检测器在 Agent 工具输出上的检出与任务阻断

    发表
    场景
    AI Agent
    被测模型
    Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    深度解读完整解读
  5. 评测与基准arXiv 2610.01428

    SAGO:从稳定性而非准确率出发的多维度大模型泛化评测

    提出 SAGO,以语义等价变体上的逐例行为稳定性评测大模型泛化

    发表
    被测模型
    Llama-3.2-3B-Instruct、Llama-3.1-8B-Instruct、Gemma-2B-IT 等 11 个
    摘要SAGO 用多轴逐例稳定性替代聚合准确率,十一个模型都未均匀泛化,且排名会随数据集改变。

    SAGO 把 LLM 泛化改写成同一目标与上下文在语义等价表达下的逐例行为稳定性,而不是单一基准上的聚合准确率。。

    深度解读完整解读
  6. 防御arXiv 2610.01170

    HeadEdit:通过冻结的 unembedding 矩阵校准语言模型行为

    提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正

    发表
    被测模型
    Qwen3-4B、Gemma-3-4B-IT、Llama-3.2-3B-Instruct 等 4 个
    摘要低秩 unembedding 校正抬高九个设置的总体准确率,并可部分预测 DPO 更新。

    HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。

    深度解读完整解读
  7. 评测与基准arXiv 2609.40111

    Agent Error Dataset 发布 5 万条错误诊断配对,用于失败分析与错误感知后训练

    构建 Agent Error Dataset,把智能体自然失败转为诊断与修复训练数据

    发表
    场景
    AI Agent
    被测模型
    Qwen3-8B
    摘要AED 把自然失败做成诊断与修正数据。

    AED是一个面向文本智能体的错误–诊断集合,用来把失败轨迹转成可分析、可训练的诊断与修正,而不是只保留最终奖励。

    深度解读完整解读
  8. 评测与基准arXiv 2609.38604

    Drift-Bench++:在沟通失误与意图漂移下评测交互式意图对齐

    提出 Drift-Bench++ 评测 Agent 在错位沟通和意图漂移下的对齐

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V4-Pro、五个 LLM backbone(Figure 3,论文未在正文逐一列出名称)
    摘要Drift-Bench++ 用可执行错位和静默漂移评测交互意图对齐,澄清有帮助但仍有差距。

    Drift-Bench++ 是面向 Interactive Intent Alignment 的可执行基准:智能体要在用户说错、目标会变、耐心有限时,持续跟上当前意图。

    深度解读完整解读
  9. 风险行为arXiv 2609.35381

    研究:MCP 错误信息面向开发者,能力越强的 Agent 受损越大

    测量面向开发者的 MCP 错误信息对工具调用 Agent 恢复的影响

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、GPT-5.6 Sol、GPT-6 Sol 等 5 个
    摘要面向开发者的 MCP 错误步骤会让只能调用工具的智能体停手。

    MCP 错误信息里的下一步常常按人类开发者来写,而只能调用服务器工具的智能体会照着做。做不到就结束回合。作者先统计这类文本,再在 BFCL V4 上只更换错误文本,看回合状态能否回到参考调用之后。

    深度解读完整解读
  10. 评测与基准arXiv 2609.35312

    MemoReason 基准

    提出 MemoReason 基准,测量参数记忆对上下文推理的影响

    发表
    被测模型
    GPT-OSS-20B、GPT-OSS-120B、OLMo-3-7B-Think 等 9 个
    摘要配对的虚构替换显示熟悉度影响推理,但模型很少直接抄回事实答案。

    MemoReason 用结构相同的事实–虚构文档配对,测量参数记忆如何影响大模型的上下文推理。

    深度解读完整解读
  11. 风险行为arXiv 2609.35928

    论文发现暴露模型身份标签会削弱多智能体 LLM 合作

    发现暴露模型家族标签会让多智能体派系化并削弱合作

    发表
    被测模型
    Gemma (gemma-4-26B-A4B-it)、GPT-OSS (gpt-oss-20b)、Nemotron (NVIDIA-Nemotron-3-Nano-30B-A3B-BF16) 等 6 个
    摘要可见身份标签让异构 LLM 群体按标签结派,共识更慢、更贵,去掉标签后该行为消失。

    Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。

    深度解读完整解读
  12. 评测与基准arXiv 2609.33658

    AgentBound:面向工具型 LLM Agent 安全的四路反事实评测框架

    提出 AGENT BOUNDARY,用四向反事实任务评测工具智能体行动边界

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash 等 15 个
    摘要四向反事实基准把过度拒绝和未授权遵从拆开,Thought 校正在十个配置上提高已授权完成。

    AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。

    深度解读完整解读
  13. 攻击arXiv 2609.28585

    论文提出持久计费状态概念,揭示工具调用 LLM Agent 的拒绝钱包攻击与防御

    定义工具调用 Agent 的持久计费状态,提出拒绝钱包攻击与防御

    发表
    场景
    AI Agent
    被测模型
    GPT-4o、GPT-4o-mini、Mistral-Large 等 7 个
    摘要已准入工具返回的跨轮保留会重复计费。

    这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。

    深度解读完整解读
  14. 评测与基准arXiv 2609.19140

    AgentLSD:在对抗性任务污染下评测 AI 安全 Agent

    评测安全 Agent 在对抗性任务污染下的解题成功与开销

    发表
    场景
    web agent
    被测模型
    Gemma-4 31B、DeepSeek-V4 Flash、GPT-OSS 120B 等 6 个
    摘要AgentLSD 用配对 web CTF 表明,欺骗性环境证据会改变安全智能体的解题率与工作量。

    AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。

    深度解读完整解读
  15. 其他arXiv 2609.08832

    自进化智能体框架缩小 LLM 智能体的「一致性差距」

    提出离线两阶段框架,诊断易翻转步骤并生成记忆指南以稳定智能体

    发表
    场景
    AI Agent
    被测模型
    GPT-4.1、GPT-OSS-120B
    摘要用离线一致性诊断生成记忆指南,在 AppWorld 上提高重复全通过率。

    作者要缩小的是 LLM 智能体平均通过、重复不稳之间的 consistency gap,即 Mean@k 减 Passˆk。

    深度解读完整解读