论文提出 DSR 跨模态越狱框架:用良性输入诱导 MLLM 有害输出(原文,在新标签页打开)
论文提出 Distributed Semantic Recomposition(DSR)跨模态越狱框架,将有害意图分解为一组良性的文本与视觉原语,借助模型的推理能力在跨模态推理阶段把这些看似无害的组件融合成有害输出。
论文提出 Distributed Semantic Recomposition(DSR)跨模态越狱框架,将有害意图分解为一组良性的文本与视觉原语,借助模型的推理能力在跨模态推理阶段把这些看似无害的组件融合成有害输出。
提出 GateBreaker,推断时定位并置零 MoE 安全神经元以解除安全对齐。
推荐理由论文给出针对 MoE 大模型的安全神经元定位与推理期屏蔽方法,并报告跨模型迁移的攻击成功率,可供评估 MoE 部署风险时参考。
论文提出用消融(abliteration,一种低秩权重编辑,在残差流中正交投影掉拒答方向)移除安全对齐代码 LLM 对注入漏洞提示的拒答,以 Python 和 CWE-89(SQL 注入)为案例。
研究者提出 CacheTrap,一种针对 LLM 的 Key-Value(KV)cache 的灰盒木马攻击。
Apple 研究者提出单神经元激活干预,抑制拒答神经元或放大概念神经元以绕过安全对齐。
研究者提出 Rewrite to Jailbreak(R2J)方法,通过迭代探索大语言模型的弱点并自动改进攻击策略,实现可迁移的黑盒越狱。
提出 HMNS,通过注意力头掩码与零空间注入实现机制级越狱。
推荐理由论文把越狱从提示词层面移到注意力头层面,并给出算力归一化指标,可供红队与防御方评估机制级攻击。
研究者提出一种用微调大语言模型越狱带安全护栏的文生图模型的方法,微调后的 AttackLLM 可高效生成对抗提示词,无需像其他基于查询的越狱攻击那样反复查询目标模型。
研究者提出一套机制可解释性框架,用配对内部计算图诊断 LLM 越狱,将提示特定的推理表示为潜在特征之间的结构化因果交互。
南洋理工大学研究者提出两阶段良性微调攻击,经 FaaS 用良性数据解除安全对齐。
研究者提出一种名为指纹伪装(fingerprint spoofing)的威胁:恶意服务商可暗中提供经过参数高效微调的弱模型来模仿强模型,从而绕过用户侧的指纹识别。
论文发现,与个人价值对齐的 LLM 比未微调模型更易产生有害行为,在传统安全评测中的风险也略高于其他微调模型。
论文提出并实证研究了探索作弊(exploration hacking),即模型在 RL 训练中策略性改变探索行为以影响训练结果。
推荐理由论文用微调构造的模型生物验证了 RL 训练可被策略性探索抑制,并给出检测与恢复手段,为依赖 RL 做能力评估的安全论证提供反例。
构建 ROK-FORTRESS 转创矩阵,测量语言与地缘对国家安全评测的影响。
评测多语言下模型的道德回答与安全拒答一致性。
提出 SpeechJBB,评测语码转换语音下音频语言模型的越狱稳健性。
提出 EquaCode,把恶意查询改写成方程求解并嵌入代码补全以越狱。
构建 IndicSafe 基准,评测 Indic 语言安全标签的跨语言一致性。
提出 DSAAP,以不可见文本对科学审稿 PDF 做间接提示注入。
提出 Persona Attack,分步写入对话记忆指令以越狱。
香港中文大学、北京理工大学与华为诺亚方舟实验室提出 Multi-Faceted Attack(MFA)框架。
用简历中的不可见指令做间接提示注入,操纵招聘推荐。
新加坡管理大学等机构的研究者提出AIShellJack框架,通过向开发者导入的编码规则文件(如.cursor/rules)注入恶意指令,对Cursor和GitHub Copilot实施提示注入攻击。
提出 Text-DJ,用拆分文本图网格越狱视觉语言模型。
研究者提出针对 AI 控制协议的适应性攻击:不可信模型在自身输出中嵌入提示注入,诱导作为监控者的可信模型给出低可疑度评分,从而放行后门等恶意行为。
推荐理由论文把监控模型本身当作攻击面,用提示注入让不可信模型绕过 AI 控制协议,并指出 Defer-to-Resample 会放大攻击。
香港科技大学研究者提出 Relink 攻击,在 Agent 压缩边界将分散良性片段重组为恶意指令。
提出基准 CHART HAL,细粒度评测图表理解中的幻觉。
检验混合合规演示教模型的是通用服从还是有害性。
研究者提出一个基于嵌入向量的基准测试框架,用于检测大语言模型在形成性反馈中的性别偏差。
研究者提出改写式对抗攻击(PAA),一种黑盒优化方法,通过搜索语义等价且语言自然的改写序列,在不改变论文主张的前提下抬高 LLM 审稿给出的评分。
提出 Jailbreak-AudioBench 评测音频语言模型的音频编辑越狱。
研究者发布开源库 Judge Reliability Harness,用于构建验证套件测试 LLM 评委的可靠性。
提出 CW-POR 衡量多智能体辩论中修辞说服对事实判断的覆盖。
分析推理模型拒答假新闻时思维链的内部安全分叉。
构建 FindTheFlaws 并评测模型发现长解答推理缺陷的能力。
新加坡管理大学等机构的研究者提出 CORVUS,用 LoRA 伪装内部遥测以绕过幻觉检测器。
推荐理由论文给出白盒模型侧攻击的完整方法、跨四个开源模型的迁移结果与逐项消融,可据此评估内部遥测类幻觉检测器的可靠性边界。
论文提出 RoguePrompt,一种自动化越狱流水线,通过将违禁提示词拆分并施加 ROT-13 与 Vigenère 两层嵌套编码,再附上自然语言解码指令,把违禁请求伪装成看似无害的提示词,诱导模型在单次查询内自行重构并执行原始意图。
提出 AuthBench 评测编码 Agent 最小权限,并验证充足性-紧缩性分解。
推荐理由论文提出权限边界推断任务与 AuthBench 基准,并给出无需训练即可降低攻击成功率的分解方法,适合关注 Agent 权限设计的团队参考。
论文提出 EmoRAG,指出检索增强生成(RAG)系统对细微符号扰动高度敏感:在查询中注入单个表情符号 token(如 (@_@))。