评测与基准arXiv 2610.08240
研究评测 32 个 LLM 的代码功能与安全差距:新模型更安全但无一消除差距
在 CWEval 上跟踪代码生成的功能-安全差距
- arXiv
- 2610.08240
- 发表
- 层
- 模型层
- 被测模型
- Gemini 1.5 Pro、Gemini 2.5 Pro、Gemini 3.1 Pro 等 20 个
摘要绝对安全性上升且差距仍在,开放权重并不分开各家族的轨迹。
在 CWEval 上跟踪代码生成的功能-安全差距
摘要绝对安全性上升且差距仍在,开放权重并不分开各家族的轨迹。
提出 VERA,审计 LLM 漏洞解释里的虚构推理
用 J-lens 检测辩论中屈从多数的智能体是否仍内部表征原前提
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
构建编码 RL 奖励作弊测试台 CATCH 并检验 CoT 监控失效
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
这是一篇对生产 HPC 上编码智能体的测量与系统议程论文,不是攻击实现或防御评测。。
证明无显式危害的图文窄微调可诱发跨任务涌现未对齐
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。
提出 CGMIA,检测代码生成基准样本是否泄漏进训练集
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。
复评前沿模型代码生成中的包名幻觉与抢注攻击面
摘要评估显示前沿模型包幻觉率收窄但威胁仍在,作者识别出跨模型通用攻击面并呼吁联合防御。