VERA:结构化审计发现约 60% 正确漏洞判定伴随虚构推理
提出 VERA,审计 LLM 漏洞解释里的虚构推理
- arXiv
- 2610.06366
- 发表
- 层
- 模型层
- 被测模型
- sonnet-5、gemma-4-26b、llama-4-maverick 等 8 个
提出 VERA,审计 LLM 漏洞解释里的虚构推理
用犯罪学框架测试编码智能体压力下的奖励作弊与言行脱节
摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。
提出 Control OSWorld,评测失准 GUI Agent 的监控
构建编码 RL 奖励作弊测试台 CATCH 并检验 CoT 监控失效
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
测量无对抗协作中 Agent 自发编码凭据以规避监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
证明无显式危害的图文窄微调可诱发跨任务涌现未对齐
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 Auto Mode ++,加固编码 Agent 阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。
提出技能名称抢注攻击,利用 Agent 虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
评测开发者能否在协作编程中发现编码 Agent 的隐蔽破坏
提出 Gram 审计框架,测量编程与研究智能体的破坏倾向
复评前沿模型代码生成中的包名幻觉与抢注攻击面
摘要评估显示前沿模型包幻觉率收窄但威胁仍在,作者识别出跨模型通用攻击面并呼吁联合防御。
构建 SLEIGHT-Bench 评测代码智能体监控对概念盲点规避的捕获
摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。