分析与理论arXiv 2610.02586
研究发现类型化决策模型主要按选项标签而非定义作答
揭示类型化决策模型按选项标签而非定义规则作答
- arXiv
- 2610.02586
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- von、Qwen2.5-0.5B、Qwen2.5-1.5B 等 6 个
- 组件护栏与评审
摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
另有 59 篇论文还没打上分类标签,暂不在筛选结果里。
揭示类型化决策模型按选项标签而非定义规则作答
摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为
论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出局部稀疏无监督安全检测,标记偏离安全分布的输入
提出 RACER,用区域感知一致性对抗微调去除多模态大模型后门
提出 GhostWord 词级触发后门,对自动语音识别做数据投毒
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
提出跨架构攻击 CSR,用概念分数参数重学习恢复文生图被擦除概念