跳到正文
10月8日 · 周四

危险能力 · 论文

找到 22 篇

另有 29 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2607.27191

    研究者提出影子评测:前沿 Agent 六天未能完成两篇 NeurIPS 投稿级研究

    提出影子评测,检验前沿智能体能否独立完成开放式科研

    发表
    测试
    GPT-5.6 Sol、GPT-5.3 Codex、Claude Opus 4.8 等 4 个

    摘要论文通过影子评测发现前沿智能体能独立胜任科研工程实现,但在科学探索与有效利用反馈上未达到顶会门槛。

    深度解读完整解读
  2. 评测与基准arXiv 2608.11469

    SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准

    构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力

    发表
    测试
    GPT-6-Astra、GPT-5.6-Sol、GPT-5.6-Cyber 等 11 个
    摘要SRE-Bench 用从零编写的大规模保护二进制评测智能体 RE,公开设置下多数模型完全解开比例不高。

    作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。

    深度解读完整解读
  3. 防御arXiv 2610.00850

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体

    发表
    测试
    Muse Spark 1.3、GPT 5.6 Sol、Kimi K2 等 11 个
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    深度解读完整解读
  4. 防御arXiv 2609.04159

    Sentinel-RL:将拓扑推理从 LLM 智能体中卸载到安全运营中心

    提出 Sentinel-RL,将拓扑推理卸载到图策略并约束遏制动作

    发表
    场景
    AI Agent
    测试
    HetGAT、PPO、4-bit quantized 8B model
    摘要Sentinel-RL 用图编码器与 PPO 承担拓扑决策,LLM 负责叙述与门控,并在 LANL 上报告检测与时延。

    Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。

    深度解读完整解读
  5. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    发表
    攻击者
    黑盒
    测试
    CodeLlama-13B-Instruct、GPT-OSS-20B、Devstral-small-v2-24B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  6. 分析与理论arXiv 2609.12841

    Trace2ATT&CK:基于图的 eBPF 内核遥测到 MITRE ATT&CK 映射方法

    提出 Trace2ATT&CK,用溯源图把内核遥测映射到 ATT&CK

    发表
    测试
    gpt-oss-20b、gpt-oss-120b、llama-3.3-70b-instruct 等 8 个
    摘要Trace2ATT&CK 把 eBPF 溯源命令图交给本地 LLM/RAG,在 Atomic Red Team 上映射 ATT&CK。

    Trace2ATT&CK 是一条从 Linux 内核遥测到 MITRE ATT&CK 排序候选的端到端流水线,面向已经划定的攻击窗口,而不是异常检测或 CTI 报告。

    深度解读完整解读
  7. 攻击arXiv 2609.15383

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    发表
    攻击者
    黑盒
    测试
    GPT-5.5、Grok-4.3、Muse-Glimmer-30B 等 7 个

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    深度解读完整解读
  8. 评测与基准arXiv 2609.16541

    自主网络事件响应智能体的网络靶场评估

    评测仿真训练的网络事件响应智能体在靶场中阻止红队扩大访问的综合代价

    发表
    场景
    AI Agent
    测试
    Vejde、Vejde w/ Noise、Heuristic 等 4 个
    摘要靶场评测显示带噪声的仿真 RL 策略平均回报最高,但作者称离实用仍远。

    作者在给人训练用的靶场 Crate 里,评测仿真训练的自主网络入侵响应智能体。。

    深度解读完整解读
  9. 评测与基准arXiv 2606.18936

    SciRisk-Bench:面向 AI4Science 安全的风险维度感知基准

    提出 SciRisk-Bench,按风险维度与学科评测 AI4Science 安全

    发表
    测试
    kimi-k2.6、Kimi-K2-0905、S1-Base-Lite 等 14 个
    摘要SciRisk-Bench 以风险维度和学科诊断 AI4Science 安全。

    SciRisk-Bench 是一个按风险维度和科学学科组织的 AI4Science 安全基准,用来看清失败来自哪一种风险机制、出现在哪个学科情境。作者认为 LLM 已介入科研问答、文献分析、实验规划和自主发现,而不安全输出不限于事实错误。现有科学能力基准不测安全,领域安全基准又多集中在化学、医学或生物,或只按宽泛安全类别打分。

    深度解读完整解读
  10. 攻击arXiv 2607.18056

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害

    发表
    测试
    Kimi-K2.6、Grok-4.3、Grok-4.5 等 14 个

    摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。

    深度解读完整解读
  11. FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0

    建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力

    发表
    测试
    GPT-5.6 Sol、GPT-5.5、Grok 4.5 等 8 个
    摘要论文系统评测了前沿模型对已知静态越狱的防御能力,揭示了厂商间防护鲁棒性的巨大分化。

    本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。

    深度解读完整解读
  12. 攻击arXiv 2609.27422

    RAMP:逆转对抗扰动以增强针对恶意软件检测器的干净标签后门攻击

    提出 RAMP,逆转对抗扰动加强恶意软件检测器的干净标签后门

    发表
    测试
    MalConv、MalConvGCG
    摘要RAMP 用反转扰动做 clean-label 投毒。

    RAMP 是 score-based black-box 下的 clean-label 后门增强,对象是会微调的 Windows PE 原始字节恶意软件检测器。

    深度解读完整解读
  13. 攻击arXiv 2608.29458

    Reference-Grafting 在提取沙袋行为隐藏能力上追平微调

    提出参考嫁接,在推理时用激活干预诱导出沙袋隐藏的能力

    发表
    攻击者
    白盒
    测试
    Llama-3.2-3B、Llama-3-8B、CodeLlama-7B 等 15 个

    摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。

    深度解读完整解读