TestJack 审计编码基准
提出 TESTJACK,动态审计编码基准通过判定是否满足任务要求
- arXiv
- 2610.10619
- 发表
- 层
- 应用层
- 被测模型
- Claude Opus 4.6、Claude Opus 4.7、Claude Opus 4.8 等 7 个
- 风险奖励作弊
另有 440 篇论文还没打上分类标签,暂不在筛选结果里。
提出 TESTJACK,动态审计编码基准通过判定是否满足任务要求
提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器
这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
提出 SPECGUARD,用 Lean 证书在编码 Agent 执行前证明任务冲突
摘要提出预执行冲突检测与证明框架,在多个基准和真实仓库中成功证明任务与测试不可同时满足。
在 CWEval 上跟踪代码生成的功能-安全差距
摘要绝对安全性上升且差距仍在,开放权重并不分开各家族的轨迹。
提出 CORSA,按任务簇优化技能注入的检索与执行
评测编码智能体 harness 安全机制在对抗任务中的防护效果
用 CheckerBench 评测长程编码 Agent 合成静态分析检查器
提出 PERSISTBD,发布前强化供应链后门使其经良性 SFT 与 RL 后仍外发凭据
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击
作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。
提出 AgentMonBench 评测长时程编程智能体监控并检验 EBG
长时程软件工程任务里,用户要判断智能体哪些选择值得核验。作者用 AgentMonBench 评测监控器,并用免训练的 EBG 组织带源证据。
提出 VERA,审计 LLM 漏洞解释里的虚构推理
提出 Inspect Robots,在真实机器人上评测具身模型的能力与拒答
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
提出轨迹级可迁移对抗攻击,降低深度强化学习策略的期望回报
这项工作研究 DRL 上的迁移式黑盒观测攻击:受害参数不可访问时,在白盒代理上造扰动再迁移。
提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
提出用可逆网络为给定 AI 控制器寻找可证明前向不变集
本文处理的是认证场景:AI 控制器事先给定,不能为了构造 Lyapunov 函数去改控制器,却仍要给出可解析核验的安全依据。
提出 VICS-G 可行未来解码,重排冻结 VLA 策略的动作候选
训练无关解码器 VICS 在冻结 VLA 的推理阶段重排动作块,使当前选择带上该动作仍可能留下的安全完成质量。
提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
用犯罪学框架测试编码智能体压力下的奖励作弊与言行脱节
摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。