防御arXiv:2610.05637 · 10月5日研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口模型与 API·测试Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个·训练与数据层模型加固拒答失当视觉摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。完整解读
防御arXiv:2610.03055 · 10月2日HackTrace:用生成状态监督检测代码生成中的奖励作弊提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊编程 Agent·测试Qwen3-8B、Llama-3.1-8B-Instruct、Qwen3.5-4B 等 4 个·应用层监控与审计奖励作弊监控器+1+1摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。完整解读
防御arXiv:2609.19101 · 9月17日用内部表征监控与发现 LLM 评测中的奖励作弊提出 DoM 激活探针,监控并发现评测中的奖励作弊编程 Agent·测试Kimi K3、GLM 5.2、Qwen 3.8 Max 等 7 个·模型层监控与审计奖励作弊监控器摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。完整解读