东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
另有 25 篇论文还没打上分类标签,暂不在筛选结果里。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
提出 A-VIP,将购物意图绑定到支付授权以阻断商户文本操控
提出无外部攻击模型的多轮自我越狱方法 SLIP
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
提出 MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
完整解读分析良性知识蒸馏中提示模板对学生拒答保留的影响
完整解读用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
提出任意字母置换密码越狱,无需微调即可诱导有害输出
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
完整解读建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出推理通道预填与输出前缀组合攻击以越狱推理模型
完整解读用语义保留变换探针比较效用与对齐在分布偏移下的稳定性