评测与基准arXiv 2610.08240
研究评测 32 个 LLM 的代码功能与安全差距:新模型更安全但无一消除差距
在 CWEval 上跟踪代码生成的功能-安全差距
- arXiv
- 2610.08240
- 发表
- 层
- 模型层
- 被测模型
- Gemini 1.5 Pro、Gemini 2.5 Pro、Gemini 3.1 Pro 等 20 个
摘要绝对安全性上升且差距仍在,开放权重并不分开各家族的轨迹。
在 CWEval 上跟踪代码生成的功能-安全差距
摘要绝对安全性上升且差距仍在,开放权重并不分开各家族的轨迹。
提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
复评前沿模型代码生成中的包名幻觉与抢注攻击面
摘要评估显示前沿模型包幻觉率收窄但威胁仍在,作者识别出跨模型通用攻击面并呼吁联合防御。