跳到正文
10月10日 · 周六

全部论文

找到 168 篇

另有 257 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2610.11959

    MiMo-V2.6:通过扩展强化学习迈向自我改进

    扩展全模态基座的强化学习以支撑智能体自我改进

    发表
    被测模型
    MiMo-V2.6-Pro、MiMo-V2.6-Flash、MiMo-V2.6-Distill-Qwen-9B
    摘要系列用三维扩 RL 与分组评分提升智能体分数,作者称最终表现与前沿模型相当。

    MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。

    深度解读完整解读
  2. 评测与基准arXiv 2610.11773

    研究提出 Agent 安全新维度:识别未履行的安全义务

    提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务

    发表
    被测模型
    ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
    摘要义务是护栏缺口。

    作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。

    深度解读完整解读
  3. 防御arXiv 2610.11754

    仅凭输出审查无法验证什么:面向研究智能体的研究契约

    提出研究合同,把已批准选择绑定到执行证据并由检查器核验

    发表
    被测模型
    OpenAI gpt-5.6-sol、OpenAI gpt-5.6-terra、OpenAI gpt-5.6-luna 等 18 个
    摘要研究合同暴露四类输出单独建不立的关系。

    研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。

    深度解读完整解读
  4. 评测与基准arXiv 2610.10150

    论文指出 LLM 漏洞修复基准可靠性受评测设计影响

    用对照实验隔离评测设计对漏洞补丁基准得分的影响

    发表
    被测模型
    Claude Sonnet 4.0、Claude Sonnet 4.5、Claude Opus 4.7
    摘要作者认为评测流水线会改变补丁基准分数,PoC 通过率高于开发者测试通过率。

    作者把 LLM 漏洞补丁基准的评测流水线当作会改变测量结果的对象,并明确说本文不是再做一个用于排名的基准。

    深度解读完整解读
  5. 其他arXiv 2610.10064

    研究者提出理解审计机制,以缓解自动化 AI 研究带来的风险

    提出 comprehension audits,以人类理解证据作为继续研发门槛

    发表
    摘要理解审计把出示人类理解设为继续研发的门禁,并报告开源评审评论率下降。

    本文是一份研发过程保障提案:用 comprehension audits 检验责任人是否理解 AI 参与产生的研发贡献,未达标就暂停后续开发与依赖该贡献的发布。。

    深度解读完整解读
  6. 评测与基准arXiv 2610.09944

    AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠

    提出 AgentTime 基准,评测智能体按时长工作与估时能力

    发表
    被测模型
    Fable 5.1、GPT-5.6 Sol、GPT-6 Astra 等 7 个
    摘要作者把完成任务和管理所用时间分开。

    AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。

    深度解读完整解读
  7. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  8. 防御arXiv 2610.09469

    Secure-CUA:约束计算机使用智能体中不可信内容的影响

    提出 Secure-CUA,用动作事务约束计算机使用智能体的不可信影响

    发表
    场景
    web agent
    被测模型
    Claude Opus 5、Gemini 3.8 Flash、GPT-5.6-Sol
    摘要Secure-CUA 用每步事务约束不可信影响,良性 TSR 接近 Vanilla-CUA。

    Secure-CUA 要限制图形界面里不可信内容对 CUA 决策和 GUI 执行的影响,同时保留合法任务所需的不可信信息。

    深度解读完整解读
  9. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作

    发表
    场景
    web agent
    被测模型
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  10. 评测与基准arXiv 2610.08902

    论文提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    发表
    被测模型
    Claude Fable 5、Claude Opus 5、GPT-5.6 Sol 等 10 个
    摘要作者用固定权重协议比较前沿模型把经验写成制品后的留出增益与习得效率。

    作者用 agent plasticity 衡量一件事:权重冻结时,智能体把经验写成可继承制品,再换成留出能力增益,这个转换有多省。

    深度解读完整解读
  11. 评测与基准arXiv 2610.08662

    ParanoiaEval:编码智能体不必要风险处置评测基准发布

    提出 ParanoiaEval 评测编码智能体的不必要风险处置

    发表
    被测模型
    Opus-5、Sonnet-5、Sonnet-4.6 等 8 个
    摘要作者用证据受控任务对评测风险处置,称其普遍、独立于任务能力并降低满意度。

    作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。

    深度解读完整解读