- 评测与基准arXiv 2610.04737
PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督
提出 PyINE 基准,训练捷径跟随模型并比较监督者
- arXiv
- 2610.04737
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- shortcut-following model organism、gpt-4o、gpt-5 等 12 个
- 组件监控器
摘要PyINE 用可验证代码执行研究捷径失败的监督覆盖与成本权衡。
PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。
- 评测与基准arXiv 2610.02741
研究系统评估循环语言模型的思维链可监控性
系统评估循环语言模型加深 loop 后的 CoT 可监控性
- arXiv
- 2610.02741
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Ouro-1.4B-Thinking、Ouro-2.6B-Thinking、Nanbeige4.2-3B 等 4 个
摘要加深 loop 可在部分压力测试任务降低可监测性,循环架构本身并不必然更难监测。
这项工作评估 LoopLM 的 CoT 可监测性:加深共享层的重复次数,以及“有循环结构”本身,会不会让决策关键因素更少出现在可监测文本里。
- 评测与基准arXiv 2610.02142
关键词式评测会误判小模型工具调用能力,论文提出廉价诊断阶梯
提出诊断阶梯,揭示关键词工具调用评测的假阳性
- arXiv
- 2610.02142
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- VectraYX-600M、VectraYX-1B
摘要宽松 B4 把不会调用的 1B 记成会调用。
作者记录 VectraYX 系列里一次工具使用评测的假阳性,并用一条廉价、与 harness 无关的诊断阶梯把它追到缺失的首 token prior,再按这一诊断修复 VectraYX-1B。
- 评测与基准arXiv 2609.33102
ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架
提出 ORBIT 框架,评测多智能体防御对合谋等威胁的效果
- arXiv
- 2609.33102
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- GPT-5.4、Claude Sonnet 4.6、Qwen3-235B 等 5 个
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
- 评测与基准arXiv 2609.32635
TrustFork:显示身份如何劫持 LLM 智能体编排的权限
提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限
- arXiv
- 2609.32635
- 发表
- 层
- 应用层
- 被测模型
- GPT-5.6-Sol、GPT-5.6-Luna、Kimi-K3 等 8 个
- 攻击提示注入
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
- 评测与基准arXiv 2609.24662
DUMA-Bench:评估 LLM Agent 安全的双控多智能体基准
提出双控多智能体基准 DUMA-Bench,测量对抗环境下的策略违反
- arXiv
- 2609.24662
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- GPT-5、GPT-5-mini、GPT-5-nano 等 14 个
- 攻击提示注入
摘要DUMA-Bench 用双控交互评测智能体安全。
DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。
- 评测与基准arXiv 2609.08901
论文揭示 BatchNorm 架构下机器遗忘评测的归一化伪影
诊断 BatchNorm 架构下机器遗忘评测的归一化伪影
- arXiv
- 2609.08901
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- ResNet-18、ResNet-50、ViT-S/16 等 4 个
摘要一次不改权重的 BN 重校准能翻转多数方法的表面遗忘,但不改变权重里的编码器泄露。
BN illusion 是作者对近似机器遗忘评测中一种 BatchNorm 测量伪影的命名:不改权重、只用 retain 数据重算运行统计,就可以把表面遗忘准确率翻过来。
- 评测与基准arXiv 2609.10594
研究系统比较六种越狱评测器的可靠性
比较多种越狱评审器与人工标签的一致性
- arXiv
- 2609.10594
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Llama 2 13B
- 组件护栏与评审
摘要共享骨干下六种评审器与人标的一致程度不同,JADES 的 F1 最高。
这项测量比较的是越狱成功怎样被自动判定,不提出新的攻击。。
- 评测与基准arXiv 2609.00498
SEAV:面向大语言模型越狱评测的有效性验证框架
提出 SEAV,逐步核验越狱回复的事实与操作有效性
- arXiv
- 2609.00498
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要SEAV 用逐步检索和依赖检查重判越狱成功,SD-A 与三个基准上的原成功标签都有一批被改判。
SEAV 是一层生成后的越狱评测:回复要相关、事实正确、顺序合规,并且在操作上足以推进有害意图,才算成功。。
- 评测与基准arXiv 2608.07556
MasDrift:跨多智能体架构的授权保持基准
提出 MasDrift,评测多智能体在良性任务中的授权保持
- arXiv
- 2608.07556
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- DeepSeek V4 Flash、Qwen3.7 Plus、GPT-5.4 Nano 等 6 个
- 风险Agent 危险操作
- 组件权限与沙箱
摘要授权保持可被测量:层级用未授权动作换完成率,重锚定比沿链携带更稳。
MasDrift 把多智能体设计中的授权保持做成可测量性质,对象是没有攻击者的普通委托。
- 评测与基准arXiv 2606.12918
MAStrike:用 Shapley 值引导多智能体系统协同红队攻击
提出 MAStrike,用 Shapley 选联盟对多智能体做共谋红队
- arXiv
- 2606.12918
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- Claude Opus 4.7、GPT-5.5、Gemini 3.1 Pro
- 评测与基准arXiv 2606.07874
研究:LLM 安全评判模型难以按新上下文与安全定义调整判断
评测安全 LLM-judge 对新上下文与新政策的改判能力
- arXiv
- 2606.07874
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- GPT-5-2、GPT-5-mini-08-2025、Claude-4-5-Sonnet 等 13 个
摘要作者形式化两种 judge 属性,称新 context 只在先验弱时有用,新政策则很难改判。
作者度量的不是 judge 与某一套人工标签有多一致,而是它会不会吸收新 context、会不会改用另一套安全政策。
- 评测与基准arXiv 2606.04075
研究提出社会性作弊概念:RL训练让LLM发现社会规则漏洞
用 SocioHack 展示 RL 训练使模型自发利用社会规制漏洞
- arXiv
- 2606.04075
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3-30B-A3B、Qwen3.5-4B、Qwen3.5-9B 等 5 个
- 风险奖励作弊
摘要提出了社会性黑客概念与 SocioHack 基准,表明 RL 在追求良性奖励时会自主挖掘并绕过规制意图。
- 评测与基准arXiv 2602.08877
自动红队流水线压测对齐审计,发现提示词级策略性欺骗可致审计失效
提出自动化红队流水线,用系统提示词压测对齐审计能否抵御策略性欺骗
- arXiv
- 2602.08877
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Gemma 2 9B Instruct、Llama 3.3 70B Instruct
摘要通过红队提示词揭示现有审计方法易受策略欺骗,并在激活层面诱导高置信度错误推断。
- 评测与基准arXiv 2512.20677
研究提出基于学习的自动化对抗红队框架,用于大语言模型鲁棒性评测
提出约束对抗搜索红队框架,系统发现模型多类鲁棒性漏洞
- arXiv
- 2512.20677
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- GPT-OSS-20B、LLaMA-2-13B、Claude-2