评测与基准arXiv 2610.06366
VERA:结构化审计发现约 60% 正确漏洞判定伴随虚构推理
提出 VERA,结构化审计漏洞推理中的虚构主张
- arXiv
- 2610.06366
- 发表
- 层
- 模型层
- 场景
- 编程 Agent
- 测试
- nemotron-3-nano、sonnet-5、gemma-4-26b 等 11 个
另有 435 篇论文还没打上分类标签,暂不在筛选结果里。
提出 VERA,结构化审计漏洞推理中的虚构主张
提出 HACKTRACE,用生成期激活检测代码智能体的奖励作弊
摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。
提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出 Mid-Harness,在执行前验证并选择终端智能体的候选动作
Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。
提出 CGMIA,用成员推理检测代码生成基准的数据泄漏
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。