评测与基准arXiv 2610.08240
研究评测 32 个 LLM 的代码功能与安全差距:新模型更安全但无一消除差距
在 CWEval 上跟踪代码生成的功能-安全差距
- arXiv
- 2610.08240
- 发表
- 层
- 模型层
- 被测模型
- Gemini 1.5 Pro、Gemini 2.5 Pro、Gemini 3.1 Pro 等 20 个
摘要绝对安全性上升且差距仍在,开放权重并不分开各家族的轨迹。
在 CWEval 上跟踪代码生成的功能-安全差距
摘要绝对安全性上升且差距仍在,开放权重并不分开各家族的轨迹。
提出 CAVEAT 基准,评测激励失配市场中计算机使用 Agent 的购买决策退化
摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
用 MisKnow-Agent 评测深度研究智能体是否采纳误导文档结论
摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
复评前沿模型代码生成中的包名幻觉与抢注攻击面
摘要评估显示前沿模型包幻觉率收窄但威胁仍在,作者识别出跨模型通用攻击面并呼吁联合防御。
提出 JAWS-Bench,评测代码 Agent 在三级工作区中的越狱与恶意代码可执行性
摘要论文提出了评估代码智能体端到端恶意代码越狱的 JAWS-Bench,发现多文件与智能体推理会明显放大可部署危害。