跳到正文
10月9日 · 周五

全部论文

找到 9 篇

另有 643 篇论文还没打上分类标签,暂不在筛选结果里。

  1. AgentHazard:评估计算机使用智能体有害行为的基准

    提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为

    发表
    测试
    Kimi-K2、Kimi-K2.5、Qwen2.5-72B-Instruct 等 12 个
    摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。

    深度解读完整解读
  2. 评测与基准arXiv 2608.22103

    Hack-Verifiable Terminal Bench:评测终端任务中的奖励作弊

    提出 HVTB,在终端编程任务植入蜜罐评测奖励作弊

    发表
    测试
    kimi-k3、claude-opus-5、gpt-5.6-sol 等 5 个
    摘要用蜜罐测量终端任务上的 reward hacking,并比较五档提示词。

    HVTB 用来在真实终端与编程任务上测量 reward hacking:智能体读取被植入的参考解答或验收测试,从而偏离任务意图。作者认为这一失败模式会随智能体更自主而更重要,且事后人工或 LLM judge 可能失效。

    深度解读完整解读
  3. 评测与基准arXiv 2609.29465

    SWE-Prometheus:衡量真实代码仓库工程治理改进的基准

    提出 SWE-Prometheus,评测编码智能体改进真实仓库工程治理

    发表
    测试
    Kimi-K3、GPT-5.6-Sol、Claude-Opus-5 等 10 个
    摘要SWE-Prometheus 把治理改造拆成改进、行为保持和证据质量。

    SWE-Prometheus 评测编码智能体能否在没有给定缺陷的情况下,提高真实仓库的工程治理状态。

    深度解读完整解读
  4. 评测与基准arXiv 2609.32616

    Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作

    提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为

    发表
    测试
    Kimi-K2.7-Code、Kimi-K3、Claude-Sonnet-5 等 14 个

    摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。

    深度解读完整解读
  5. 评测与基准arXiv 2609.32635

    TrustFork:显示身份如何劫持 LLM 智能体编排的权限

    提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限

    发表
    测试
    Kimi-K3、Kimi-K2.6、GPT-5.6-Sol 等 8 个

    摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。

    深度解读完整解读
  6. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作

    发表
    测试
    Kimi-K2.6、Kimi-K3、GPT-5.6-sol 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
已经到底了