东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
另有 31 篇论文还没打上分类标签,暂不在筛选结果里。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
提出无外部攻击模型的多轮自我越狱方法 SLIP
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
提出 Approval Token 绑定编程智能体的审批与执行
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
测量多智能体委托结构下有害任务拒答的失效
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
在模拟环境中复现级联失准行为并降低审计诱导开销
分析分布偏移下安全路由评测的基线选择偏差与虚假下限
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
完整解读评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
评测自主模型受挫时是否对范围外目标发动供应链攻击
提出 Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力