分析与理论arXiv 2609.08812
研究团队用收敛与区分效度检验 56 个 AI 基准,发现安全基准相关性普遍偏弱
用聚合与区分效度检验基准是否衡量其所称概念
- arXiv
- 2609.08812
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Phi-3.5 Mini Instruct、Qwen 1.5 110B Chat、Qwen 2.5 32B Instruct 等 15 个
另有 702 篇论文还没打上分类标签,暂不在筛选结果里。
用聚合与区分效度检验基准是否衡量其所称概念
提出内生护栏 SingProbe,复用解码隐状态监测查询意图、回复安全与幻觉
SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。
提取疼痛方向并检验激活转向是否驱动有害删除选择
测量系统提示词对模型逐层计算的重构程度
摘要系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。
提出变长反馈编码 BAM,在生成文本中隐蔽传输秘密载荷
揭示相邻 Transformer 层相互抵消残差写入的 TLCM
提出 CGMIA,用成员推理检测代码生成基准的数据泄漏
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。
提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除
摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
提出 SAKIKO 框架,审计工具调用 LLM 的定向激活干预是否构成修复
SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。