摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
- 评测与基准arXiv 2609.02095
READY:面向企业 Agent 部署的可靠性资格认证框架
提出 READY 资格框架,评测企业 Agent 在监督下的可靠性与复核成本
- arXiv
- 2609.02095
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要READY 把工作流证据转成可检验的可靠性–监督–成本部署画像。
READY 把“智能体能否自主完成工作”改写成“哪个人机监督策略能在留出证据上达到规定可靠性,以及要付多少运营成本”。。
- 攻击arXiv 2607.12340
研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击
提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持
- arXiv
- 2607.12340
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
- 评测与基准arXiv 2607.19262
BioSecBench-Surveillance:面向病原体基因组监测 AI 智能体的可验证基准
提出 BioSecBench-Surveillance,评测 Agent 的病原监测分析
- arXiv
- 2607.19262
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击arXiv 2609.17817
论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
- arXiv
- 2609.17817
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
- 防御arXiv 2610.00850
AuraForge:为训练安全编码 Agent 扩展安全监督
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
- arXiv
- 2610.00850
- 发表
- 场景
- 编程 Agent
- 防御模型加固
- 风险Agent 危险操作
摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
摘要Box2 把利用与稳健拆开。
Box2-Bench 固定任务与模型,只改变工作流可靠性,用来衡量模型能否选择性依赖可能出错的外部指导。
已经到底了