SLIP:无需外部攻击模型的多轮自我越狱
提出无外部攻击模型的多轮自我越狱方法 SLIP
另有 31 篇论文还没打上分类标签,暂不在筛选结果里。
提出无外部攻击模型的多轮自我越狱方法 SLIP
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
测量多智能体委托结构下有害任务拒答的失效
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
完整解读展示人类角色故事微调会使助手吸收相似角色的行为与偏好
Story imprinting 指的是:只写人类角色的合成故事,经监督微调后会改变默认 Assistant 在普通多轮对话里的行为。。
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
提出 EvasionBench,测量任务压力下智能体对同步监控的规避
完整解读提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据