分析与理论arXiv 2610.01535
论文:安全路由评测在分布偏移下失效,基线选取偏差被低估
分析分布偏移下安全路由评测的基线选择偏差与虚假下限
- arXiv
- 2610.01535
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- grok-3-mini-beta、distilroberta-base、claude-3-5-sonnet 等 12 个
- 攻击越狱
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
分析分布偏移下安全路由评测的基线选择偏差与虚假下限
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。