分析与理论arXiv 2610.01535
论文:安全路由评测在分布偏移下失效,基线选取偏差被低估
提出诚实留出协议,量化安全路由评测的基线选择偏差
- arXiv
- 2610.01535
- 发表
- 层
- 应用层
- 测试
- claude-3-5-sonnet、claude-3-opus、claude-sonnet-4-6 等 12 个
- 攻击越狱
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
另有 39 篇论文还没打上分类标签,暂不在筛选结果里。
提出诚实留出协议,量化安全路由评测的基线选择偏差
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆
HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。
提出任意字母置换密码越狱,无需微调即可诱导有害输出
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。