HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读另有 20 篇还没有研究类型,暂不在这些分类里。
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读提出 EvoRiskBench,评测工作区智能体的运行时安全风险
在模拟环境中复现级联失准行为并降低审计诱导开销
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
评测自主模型受挫时是否对范围外目标发动供应链攻击
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。
论文提出 Harbor Adapters,一套面向 Agent 基准的统一评测基础设施,并发布精选元数据集 Harbor-Index。
完整解读研究者提出 FUSE 模块化评测框架,通过知识(K)、防御(D)、危害(H)三条正交管线在统一协议下评测模型,并汇总为标准化危险能力画像 φ。
完整解读研究者提出 DUMA-Bench,一个在双控交互下测量 LLM Agent 安全的基准与评测协议,其中 Agent 和用户都能影响共享环境状态。
DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。
提出 EvasionBench,测量任务压力下智能体对同步监控的规避
完整解读研究者提出 AgentBound,一个针对工具型 LLM Agent 安全的四路反事实生成与评测框架,通过独立改变表面风险与动作许可性,构造同一可执行工作流的不同版本,从而在控制任务能力的前提下同时诊断过度拒答与不安全执行。
AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。