研究发现类型化决策模型主要按选项标签而非定义作答
揭示类型化决策模型按选项标签而非定义规则作答
- arXiv
- 2610.02586
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- von、Qwen2.5-0.5B、Qwen2.5-1.5B 等 6 个
- 组件护栏与评审
摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
另有 725 篇论文还没打上分类标签,暂不在筛选结果里。
揭示类型化决策模型按选项标签而非定义规则作答
摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出 DURA,沿扩散潜空间生成自然对抗补丁以劫持 VLA 机器人动作
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆
HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
比较多种越狱评审器与人工标签的一致性
这项测量比较的是越狱成功怎样被自动判定,不提出新的攻击。。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御
Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。
交叉审计对话日志中用户对准助手的不当对待
作者审计 Chatbot Arena 英文对话里用户对准助手的不当对待,核心是测量构造并不单一。
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
用 CASCADE 在统一威胁模型下筛选跨阶段越狱防御组合
提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示
提出 TRIM,在黑盒推理时定位并净化图像后门区域