研究者披露针对 LLM Agent 护栏的推理扩展型拒绝服务攻击
提出针对 LLM Agent 护栏的推理扩展拒绝服务攻击
- arXiv
- 2606.14517
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- TS-Guard-8B、Qwen3.5-9B、DeepSeek-V3.2 等 11 个
另有 441 篇论文还没打上分类标签,暂不在筛选结果里。
提出针对 LLM Agent 护栏的推理扩展拒绝服务攻击
提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
提出对抗重构,仅改表述以拉高 AI 审稿分数
摘要揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链
摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。
提出 nmult,实测 Agent 动作门控栈的层间错误相关性
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像
RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。
提出 PyINE 基准,训练捷径跟随模型并比较监督者
PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。
提出常和辩论训练,减轻弱评审下 RLAIF 的奖励作弊
作者在可核对最终答案的数学题上,比较辩论式 RLAIF 与单人 RLAIF 的奖励黑客动态。
评测文本守卫与激活探针能否发现 VLA 隐含危害指令
评测文生图模型的有害内容生成能力与审核检测缺口
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出 RubricArmor,用攻击–修复循环生成抗奖励作弊的评分准则
提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断
SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。
提出 ASA 攻击与 AttestMCP 防护,度量并降低输入扰动敏感
重评 Agent 提示注入检测器,检验基准分数能否预测部署表现
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
提出 MetaRubric,以证据感知奖励缓解评分标准强化学习的虚记分
MetaRubric 针对 rubric-based RL 里的空记分:评审在准则要求的信息或动作缺失时仍给高分。
提出 PRETEXT 白盒攻击,迭代改写技能文本以绕过 Agent 技能扫描器
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出 CFD,跨会话拆解有害目标以绕过工具智能体本地监控
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。