跳到正文
10月10日 · 周六

全部论文

找到 10 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.11773

    研究提出 Agent 安全新维度:识别未履行的安全义务

    提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务

    发表
    被测模型
    ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
    摘要义务是护栏缺口。

    作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。

    深度解读完整解读
  2. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  3. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御

    发表
    攻击者
    黑盒
    被测模型
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  4. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill,用跨技能组合绕过 Agent 技能扫描器

    发表
    攻击者
    黑盒、灰盒
    被测模型
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  5. BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准

    提出 BioSecBench-Refusal,评测智能体生物研发拒答与隐蔽危害识别

    发表
    被测模型
    Opus 4.8、Opus 4.7、Opus 4.6 等 10 个
    摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。

    BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。

    深度解读完整解读
  6. 防御arXiv 2606.08234

    SciTrace:面向科学发现智能体的轨迹感知安全推理框架

    提出 SciTrace,为科学发现智能体加入跨阶段安全推理与工具轨迹核验

    发表
    被测模型
    Llama-3.1-70B-Instruct、Qwen2.5-72B-Instruct、DeepSeek-V3 等 4 个
    摘要SciTrace 把安全推理织入科学智能体各阶段,在 SciSafetyBench 上提高安全指标并保持输出质量。

    SciTrace 是加在科学发现智能体流水线上的安全框架,不是再在各阶段出口放一个独立过滤器。

    深度解读完整解读
  7. 防御arXiv 2505.23559

    SafeScientist:让 LLM 智能体的科学发现具备风险意识

    提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务

    发表
    被测模型
    GPT-4o、GPT-4.1、GPT-3.5-turbo 等 5 个
    摘要四层监控加科研安全基准。

    SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。

    深度解读完整解读
  8. 防御arXiv 2312.06632

    用智能体控制化学科学中的 AI 风险:SciGuard 护栏与 SciMT 基准

    提出 SciGuard 外部护栏与 SciMT 基准,控制化学科学 AI 误用

    发表
    被测模型
    SciGuard (GPT-4)、SciGuard (Gemini)、SciGuard (Mixtral) 等 5 个
    摘要SciGuard 以外部智能体控制化学 AI 误用。

    这篇工作把化学科学 AI 的误用控制做成外部智能体,而不是改模型权重。作者担心合成规划、毒性预测和科学语言模型被用来获取有害物质信息、规避监管或传播危险知识,同时合法工业用途又不能靠一律拒绝来处理。SciGuard 由 LLM 担任中介,把原则和指南放进短期记忆,把分子库、危害库、法规和交互历史放进可检索的长期记忆,再按 Chain of Thought 调用 Chemprop、LocalRetro 等工具,或用 RAG 补法规片段,最后回答、追问或拒绝。

    深度解读完整解读
已经到底了