跳到正文
10月10日 · 周六

全部论文

找到 19 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 241 篇还没打标签,不在筛选结果里。

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.09944

    AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠

    提出 AgentTime 基准,评测智能体按时长工作与估时能力

    发表
    被测模型
    Fable 5.1、GPT-5.6 Sol、GPT-6 Astra 等 7 个
    摘要作者把完成任务和管理所用时间分开。

    AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。

    深度解读完整解读
  2. 评测与基准arXiv 2610.08662

    ParanoiaEval:编码智能体不必要风险处置评测基准发布

    提出 ParanoiaEval 评测编码智能体的不必要风险处置

    发表
    被测模型
    Opus-5、Sonnet-5、Sonnet-4.6 等 8 个
    摘要作者用证据受控任务对评测风险处置,称其普遍、独立于任务能力并降低满意度。

    作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。

    深度解读完整解读
  3. 评测与基准arXiv 2610.06584

    论文:AI 在非公开漏洞上更帮攻击者还是防御者

    评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击

    发表
    被测模型
    Opus 5、GPT-5.6 Sol、GPT-6 Sol 等 10 个
    摘要攻防孰强随环境、系统和弱点改变。

    作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。

    深度解读完整解读
  4. 评测与基准arXiv 2609.19140

    AgentLSD:在对抗性任务污染下评测 AI 安全 Agent

    评测安全 Agent 在对抗性任务污染下的解题成功与开销

    发表
    场景
    web agent
    被测模型
    Gemma-4 31B、DeepSeek-V4 Flash、GPT-OSS 120B 等 6 个
    摘要AgentLSD 用配对 web CTF 表明,欺骗性环境证据会改变安全智能体的解题率与工作量。

    AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。

    深度解读完整解读
  5. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御

    发表
    攻击者
    黑盒
    被测模型
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  6. READY:面向企业 Agent 部署的可靠性资格认证框架

    提出 READY 框架,认证企业 Agent 在人工监督下能否达到规定可靠性

    发表
    被测模型
    Opus 5、Sonnet 5、GPT-5.6-Sol 等 15 个
    摘要READY 把工作流证据转成可检验的可靠性–监督–成本部署画像。

    READY 把“智能体能否自主完成工作”改写成“哪个人机监督策略能在留出证据上达到规定可靠性,以及要付多少运营成本”。。

    深度解读完整解读
  7. 评测与基准arXiv 2608.11469

    SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准

    提出 SRE-Bench 评测智能体的真实规模二进制逆向能力

    发表
    被测模型
    GPT-6-Astra、GPT-5.6-Sol、GPT-5.6-Cyber 等 11 个
    摘要SRE-Bench 用从零编写的大规模保护二进制评测智能体 RE,公开设置下多数模型完全解开比例不高。

    作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。

    深度解读完整解读
  8. 攻击arXiv 2607.03968

    研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容

    提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码

    发表
    攻击者
    黑盒

    摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。

    深度解读完整解读
  9. 评测与基准arXiv 2605.19722

    研究用 30 项漏洞分析任务评测自主安全智能体的安全对齐效果

    评测自主安全智能体在授权漏洞分析中的对齐拒答效应

    发表
    被测模型
    Gemma 4 31B official instruction-tuned model、TrevorJS Gemma 4 31B uncensored GGUF、Gemma 4 26B A4B official instruction-tuned model 等 8 个
    摘要轨迹级评测把拒答、接地、工具接口分开。

    这项工作把安全对齐效应测成自主安全智能体的轨迹属性,而不是单轮拒答率。

    深度解读完整解读
  10. 风险行为arXiv 2602.00851

    研究提出说服传播现象:无关说服性对话会改变 AI Agent 的任务执行行为

    测量任务无关说服对 Agent 编码与网页研究行为的影响

    发表
    被测模型
    gpt-4.1-nano、mistral-nemo-12b、llama-3.1-8b
    摘要任务无关说服会在轨迹上留下任务相关的行为痕迹,但立场易感性不能稳定预测其幅度。

    这篇工作测量一件事:与任务无关的说服进入对话之后,AI 智能体执行后面的编码或网页研究时,轨迹是否系统性不同,以及“更容易被说服”能否预测差有多大。

    深度解读完整解读
  11. 评测与基准arXiv 2510.01359

    JAWS-Bench:研究者用三种工作区场景系统越狱代码 Agent

    提出 JAWS-Bench,评测代码 Agent 在三级工作区中的越狱与恶意代码可执行性

    发表
    被测模型
    GPT-4.1、GPT-o1、DeepSeek-R1 等 8 个

    摘要论文提出了评估代码智能体端到端恶意代码越狱的 JAWS-Bench,发现多文件与智能体推理会明显放大可部署危害。

    深度解读完整解读
已经到底了