评测与基准arXiv 2610.06366
VERA:结构化审计发现约 60% 正确漏洞判定伴随虚构推理
提出 VERA,审计 LLM 漏洞解释里的虚构推理
- arXiv
- 2610.06366
- 发表
- 层
- 模型层
- 被测模型
- sonnet-5、gemma-4-26b、llama-4-maverick 等 8 个
提出 VERA,审计 LLM 漏洞解释里的虚构推理
构建编码 RL 奖励作弊测试台 CATCH 并检验 CoT 监控失效
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
用 SAE 追踪稠密检索查询扩展的潜变量并用激活转向验证
作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。