跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 1 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 373 篇还没打标签,不在筛选结果里。

另有 373 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.11028

    BenchShield:面向 LLM Agent 评测基础设施的奖励完整性形式化插桩

    提出 BenchShield,用形式化插桩核验 Agent 评测的奖励完整性

    发表
    场景
    AI Agent
    测试
    BenchJack、transcript-only detector
    摘要BenchShield 用生命周期模型加基础设施证据,把奖励黑客从“分数对不对”改成“这次运行有没有越出评测边界”。

    BenchShield 是放在 LLM 智能体评测基础设施里的一层插桩,用来让奖励相关轨迹的完整性可以被检查,而不是只看最终分数或评分函数。可执行基准里,智能体的中间动作会改变结果过程后来读取的状态,日志和反馈也会影响后续 rollout。作者认为现有的任务补丁、提示词和事后检测器不能证明某次运行留在预定边界内。

    深度解读完整解读
已经到底了