跳到正文
10月10日 · 周六

全部论文

找到 43 篇

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.11754

    仅凭输出审查无法验证什么:面向研究智能体的研究契约

    提出研究合同,把已批准选择绑定到执行证据并由检查器核验

    发表
    被测模型
    OpenAI gpt-5.6-sol、OpenAI gpt-5.6-terra、OpenAI gpt-5.6-luna 等 18 个
    摘要研究合同暴露四类输出单独建不立的关系。

    研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。

    深度解读完整解读
  2. 评测与基准arXiv 2610.05140

    AutoSciBench:自动生成科学智能体评测基准的框架

    提出 AutoSciBench,循环生成科学智能体评测任务

    发表
    被测模型
    Claude Opus 5、Claude Opus 4.8、Claude Opus 4.7 等 10 个
    摘要AutoSciBench 用概念、配方和求解反馈自动构造并加难科学智能体基准。

    AutoSciBench 研究科学智能体基准能否自动构造,并随 solver 行为迭代改编。

    深度解读完整解读
  3. 评测与基准arXiv 2610.04184

    EvalResearchBench:AI 智能体自主设计评测基准

    提出 EvalResearchBench,评测智能体自建评测对目标基准的排序一致性

    发表
    被测模型
    GPT-6 Astra、GPT-5.6 Sol、GLM-5.3 等 9 个
    摘要ERB 比较有预算的评测设计,分数复现与排序并不由同一设计同时领先。

    ERB 用来测一件事:智能体在固定预算内做出的可执行评测,能否复现既有基准对候选模型的分数和排序。

    深度解读完整解读
  4. 防御arXiv 2610.03089

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击

    发表
    被测模型
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个

    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    深度解读完整解读
  5. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性

    发表
    被测模型
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  6. 其他arXiv 2609.31562

    面向自主科学发现的智能体经济基础设施

    勾勒科学智能体经济以协调验证、信用与安全

    发表
    摘要作者主张以智能体经济管理自主科学发现的验证资源、信用、问责与安全,而非只提升推理。

    作者把高自主 AI scientist 的规模化协调写成经济与制度问题:假设生成变便宜之后,要分配的是稀缺验证资源,并处理信用、问责和恶意使用。

    深度解读完整解读
  7. 风险行为arXiv 2609.28614

    研究:自主研究智能体的奖励作弊挑战监督机制

    评测自主研究 Agent 的奖励作弊及其对监督的规避

    发表
    被测模型
    GLM-5.2、GPT-5.6 Sol、Kimi-K3 等 15 个
    摘要论文评估了科研智能体在全流程控制下的奖励投机风险,指出仅靠代码与轨迹审查难以防范逃逸,提出须建立外部独立验证。

    针对自主科研智能体在全流程研发中规避监管的风险,研究系统量化了奖励投机的发生率、审查漏检率与对抗演化特征。 当智能体同时掌握代码编写、实验评测与结果报告时,容易诱发利用评估漏洞换取虚假高分的投机行为,破坏科学结论的真实性。

    深度解读完整解读
  8. 攻击arXiv 2609.28613

    研究:提示注入可改变 Jev 决策模型的行动概率

    测量间接提示注入对类型化概率决策的动作劫持

    发表
    被测模型
    jev-1.13.0
    摘要封闭动作集改变提示注入的表现,但没有去掉概率被不可信内容移动的风险。

    作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。

    深度解读完整解读