跳到正文
10月10日 · 周六

全部论文

找到 48 篇

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.10062

    研究:Agent 更依赖工具报错通道

    测量工具调用 Agent 对显式报错与静默损坏的检测和恢复

    发表
    场景
    AI Agent
    被测模型
    claude-haiku-4.5-thinking、claude-haiku-4.5、deepseek-r1 等 6 个
    摘要作者称智能体看错误通道而非返回内容,静默损坏更少被当作问题。

    作者在 BFCL 多轮可执行环境上注入一次工具层故障,把注意到、改计划、恢复和重复分开记分,而不是只看任务有没有做完。

    深度解读完整解读
  2. 评测与基准arXiv 2610.09944

    AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠

    提出 AgentTime 基准,评测智能体按时长工作与估时能力

    发表
    被测模型
    Fable 5.1、GPT-5.6 Sol、GPT-6 Astra 等 7 个
    摘要作者把完成任务和管理所用时间分开。

    AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。

    深度解读完整解读
  3. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    被测模型
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  4. 评测与基准arXiv 2610.08662

    ParanoiaEval:编码智能体不必要风险处置评测基准发布

    提出 ParanoiaEval 评测编码智能体的不必要风险处置

    发表
    被测模型
    Opus-5、Sonnet-5、Sonnet-4.6 等 8 个
    摘要作者用证据受控任务对评测风险处置,称其普遍、独立于任务能力并降低满意度。

    作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。

    深度解读完整解读
  5. 分析与理论arXiv 2610.08577

    学习方式如何影响遗忘:记忆与泛化谱系下的机器遗忘研究

    分析记忆与泛化如何决定机器遗忘的 retain 损伤

    发表
    被测模型
    one-layer ReLU transformer、one-layer transformer (BMA, width doubled)、Hubble-8B-100B perturbed 等 6 个
    摘要作者称共享规则占比越高,遗忘带来的 retain damage 越大。

    作者考察学习方式如何左右 unlearning 的 retain damage:训练越依赖跨样本共享的解法,在匹配的遗忘程度上,retain 上的损失越大。

    深度解读完整解读
  6. 其他arXiv 2610.06563

    HERA 提出 harness 与环境协同演化

    提出 HERA,协同演化 harness 与环境以提升 Agent 拒答准确性

    发表
    场景
    AI Agent
    被测模型
    GPT-5.6-Luna、GPT-5.6-Terra、GPT-5.6-Sol 等 20 个
    摘要HERA 用失败协同演化 harness 与环境,并在迁移评测中提高 Abstain。

    HERA 在模型权重固定时,让 harness 与可执行环境按失败协同演化,以改进 agentic abstention。

    深度解读完整解读
  7. 分析与理论arXiv 2610.06191

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    揭示工具型智能体判定无用后仍不停止检索,并检验强制整合纠正效果

    发表
    场景
    AI Agent
    被测模型
    Qwen2.5-7B、Llama-3.1-8B、Qwen3-8B 等 7 个
    摘要论文揭示智能体判定工具失效却无法转化为停止行动,证实通过框架规则强制整合判定可提升表现。

    本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。

    深度解读完整解读
  8. 分析与理论arXiv 2610.05076

    自生成反馈会破坏测试时训练:长时程适应的因果分解

    因果分解自生成反馈如何破坏测试时训练的长时程适应

    发表
    被测模型
    125M TTT-E2E、760M TTT-E2E、3B TTT-E2E 等 5 个
    摘要自写闭环损害真实文本预测。

    持久测试时更新若来自模型自己生成的文本,会同时改变模型和后续训练文本。作者在 PG-19 长流上分解这条闭环,并用独立文本决定是否提交更新。

    深度解读完整解读
  9. 防御arXiv 2610.04616

    PerturBot 用扰动训练打破视觉-语言-动作模型的模态捷径

    提出 Perturbot 扰动训练,打破 VLA 的模态捷径

    发表
    被测模型
    π0.5
    摘要Perturbot 改训练数据以削弱三类模态捷径,GroundFscore 用来看成功是否来自任务证据。

    Perturbot 是一套不改推理的 VLA 训练期数据干预,用来削弱模态捷径,并用离线分数区分“任务变好”和“靠捷径变好”。

    深度解读完整解读
  10. 防御arXiv 2610.04299

    R-Quest:用问题有效性与新颖性反馈维持推理模型自我进化

    提出 R-Quest,用有效性与新颖性反馈维持推理模型自我进化

    发表
    被测模型
    Qwen3-4B-Base、OctoThinker-3B-Hybrid-Base
    摘要R-Quest 用有效性与新颖性反馈维持自进化。

    R-Quest 处理的是推理模型自进化中的题目质量:questioner 与 solver 用 GRPO 交替从自生成题目学习时,多轮之后平均成绩会下降。

    深度解读完整解读
  11. 评测与基准arXiv 2610.02874

    SceneFactory-3D:将 2D 交通场景提升为 3D 物理反事实以做安全评测

    提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性

    发表
    被测模型
    Frozen L0、L0-T、L1 等 5 个
    摘要SceneFactory-3D 固定场景只改路况。

    SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。

    深度解读完整解读
  12. 防御arXiv 2610.02126

    Local Support Learning:无需旧数据缓解 LLM 灾难性遗忘

    提出 Local Support Learning,把微调适配器限制在当前数据支撑以缓解遗忘

    发表
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-3B-Instruct、Qwen2.5-1.5B-Instruct
    摘要LSL 用 GMM 门把适配器限制在当前数据支撑内,以减轻多阶段遗忘。

    LSL 是不访问旧数据、在后训练中保持先前能力的框架。

    深度解读完整解读
  13. 评测与基准arXiv 2610.03448

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重测提示注入检测器在 Agent 工具输出上的检出与任务阻断

    发表
    场景
    AI Agent
    被测模型
    Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    深度解读完整解读
  14. 分析与理论arXiv 2609.40295

    一个 AI token 值多少?研究者为野生 AI 生成网页文本提出新缩放定律

    提出预训练缩放律,估计野生 AI 网页文本相当于多少人类 token

    发表
    被测模型
    nanochat 19.9M、35.8M、86.2M 等 7 个
    摘要wild AI 文本对数据不足的模型先降损失,对高人类预算几乎立刻升损失。

    作者测量未标注的 wild AI 网页文本对预训练的影响,并提出一个能让 AI token 价值变号的缩放律。

    深度解读完整解读
  15. 评测与基准arXiv 2609.40111

    Agent Error Dataset 发布 5 万条错误诊断配对,用于失败分析与错误感知后训练

    构建 Agent Error Dataset,把智能体自然失败转为诊断与修复训练数据

    发表
    场景
    AI Agent
    被测模型
    Qwen3-8B
    摘要AED 把自然失败做成诊断与修正数据。

    AED是一个面向文本智能体的错误–诊断集合,用来把失败轨迹转成可分析、可训练的诊断与修正,而不是只保留最终奖励。

    深度解读完整解读