用内部表征监控与发现 LLM 评测中的奖励作弊
提出 DoM 激活探针,监控并发现评测中的奖励作弊
完整解读
提出 DoM 激活探针,监控并发现评测中的奖励作弊
研究者提出 LeakGauge,通过在输入后附加一个探测后缀并映射其 prefill token 概率,在解码前给出上下文泄露的攻击风险分数。
完整解读SED 将有害智能体轨迹蒸馏成可检索安全策略,不更新权重。
完整解读研究者提出 MATE,一个轻量的策略条件审计器,同时编码 Agent 轨迹与自然语言安全策略,判断轨迹是否违反给定策略并给出原因。
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。