研究者提出可检查评分器与自改进 Agent 共同演化方法
演化可检查评分器并与自改进 Agent 共同演化,抑制奖励作弊
- arXiv
- 2610.11464
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Claude Opus 4.7
摘要十项锚点演化可检查评分器。
开放任务没有验证器时,被演化的是评分器,而不是再补一条手写 rubric。
另有 427 篇论文还没打上分类标签,暂不在筛选结果里。
演化可检查评分器并与自改进 Agent 共同演化,抑制奖励作弊
开放任务没有验证器时,被演化的是评分器,而不是再补一条手写 rubric。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器
这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。
提出 VeriFine,用双环协同扩展验证以实现具身推理自我改进
VeriFine 把驾驶和导航推理的自改进写成策略、课程和无参考评审的协同演化,用来处理固定评审跟不上新失败模式的问题。
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
提出 nmult 并评测 Agent 动作门禁堆叠的错误相关性
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
评测文生图模型的有害内容生成能力与审核检测缺口
提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为
CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。
评测文本守卫与激活探针能否拦住机器人隐含伤害指令
构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
提出 HAL 污染审计框架并核验智能体排行榜评分器
作者给出一套测量优先审计框架,用来判断智能体排行榜上的污染主张各自需要何种证据。
提出 RubricArmor,用攻击–修复循环生成抗奖励作弊的评分准则
提出 PyINE 基准,训练捷径跟随模型并比较监督者
PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。
提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位
这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。
提出 CorrectGuard,在不可查看输入上估计黑盒护栏决策对错
CorrectGuard 面向不能人工检查生产输入、也没有生产标签的黑盒安全护栏,用外部模型估计单条决策是否正确,并据此排序和弃权。离线基准会随数据和攻击变化,未必代表生产分布。隐私约束还可能禁止模型查看原文或可反演的稠密嵌入。
提出 Persona Guardrail,强制客服智能体守住功能边界
Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。
提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断
SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。
提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱
给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。
提出 MetaRubric,以证据感知奖励缓解评分标准强化学习的虚记分
MetaRubric 针对 rubric-based RL 里的空记分:评审在准则要求的信息或动作缺失时仍给高分。