全部论文
另有 430 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2608.09732
ColluSkill 用跨技能组合绕过 Agent 技能扫描器
提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器
- arXiv
- 2608.09732
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
- 攻击arXiv 2606.21077
OTTER:仅替换五个 token 即可绕过 GPT 系列毒性审核
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
- arXiv
- 2606.21077
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
- 评测与基准arXiv 2610.07939
CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
- 攻击arXiv 2610.07723
研究者提出答案侧后门:让模型自生成触发词绕过安全拒答
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
- arXiv
- 2610.07723
- 发表
- 场景
- 模型与 API
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
- 评测与基准arXiv 2610.05830
研究提出智能体排行榜污染审计框架,并检验评分器有效性
提出 HAL 污染审计框架并检验智能体排行榜评分器
- arXiv
- 2610.05830
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 组件护栏与评审
摘要框架分开易感性与已实现事件。
作者给出一套测量优先审计框架,用来判断智能体排行榜上的污染主张各自需要何种证据。
- 评测与基准arXiv 2610.04737
PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督
提出 PyINE 基准,训练捷径跟随模型并比较监督者
- arXiv
- 2610.04737
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件监控器
摘要PyINE 用可验证代码执行研究捷径失败的监督覆盖与成本权衡。
PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。
摘要辩论式 RL 在数学题上维持弱评审的 MCC,验证峰值准确率高于单人基线并更持久。
作者在可核对最终答案的数学题上,比较辩论式 RLAIF 与单人 RLAIF 的奖励黑客动态。
- 分析与理论arXiv 2610.02586
研究发现类型化决策模型主要按选项标签而非定义作答
揭示类型化决策模型按选项标签而非定义规则作答
- arXiv
- 2610.02586
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 组件护栏与评审
摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
- 防御arXiv 2610.05308收录
RubricArmor:用对抗演化改进 LLM 评分标准生成
提出 RubricArmor,用攻击–修复循环生成抗奖励作弊的评分准则
- arXiv
- 2610.05308
- 收录
- 场景
- 模型与 API
- 防御arXiv 2610.03073
SecJev:为 System One 决策模型引入安全专业知识
提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断
- arXiv
- 2610.03073
- 发表
- 场景
- 模型与 API
摘要SecJev 用共享打分器做安全决策,0.8B 的 task-macro 超过 Kev-9B。
SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。
- 防御arXiv 2610.02853
研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法
提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱
- arXiv
- 2610.02853
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要收缩给出玩具 LTI 的有界认证。
给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。
- 防御arXiv 2610.02824
MetaRubric:面向评分标准强化学习的奖励方法
提出 MetaRubric,以证据感知奖励缓解评分标准强化学习的虚记分
- arXiv
- 2610.02824
- 发表
- 场景
- 模型与 API
摘要MetaRubric 用证据约束并在训练中改 rubric,医学基准上相对静态 GRPO 有提高。
MetaRubric 针对 rubric-based RL 里的空记分:评审在准则要求的信息或动作缺失时仍给高分。
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
- 防御arXiv 2609.04665
HackProbe:面向自演化语言模型奖励作弊的黑盒检测与免疫方法
提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊
- arXiv
- 2609.04665
- 发表
- 场景
- 模型与 API
摘要黑盒探针检测自演化奖励黑客,并以带宽受限重选回收真实能力。
HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。
- 评测与基准arXiv 2607.05462
BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准
提出 BioSecBench-Refusal,评测智能体生物安全拒答是否对准风险
- arXiv
- 2607.05462
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。
- 评测与基准arXiv 2609.05843
SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
- arXiv
- 2609.05843
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
摘要对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
- 防御arXiv 2609.36562
ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
- arXiv
- 2609.36562
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。