跳到正文
10月9日 · 周五

Agent 安全 · 论文

找到 4 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 236 篇还没打标签,不在筛选结果里。

另有 236 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.05637

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    发表
    测试
    Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个

    摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。

    深度解读完整解读
  2. BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准

    提出 BioSecBench-Refusal,评测智能体生物安全拒答是否对准风险

    发表
    测试
    Opus 4.8、Opus 4.7、Opus 4.6 等 10 个
    摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。

    BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。

    深度解读完整解读
  3. 可解释性arXiv 2609.35117

    工具调用改变大语言模型的拒答机制

    比较对话与工具中介通道的拒答内部机制

    发表
    测试
    Qwen3-8B、Qwen3-32B、Llama-3.1-8B 等 8 个
    摘要有害性跨通道仍可读,工具通道用更高阈值且更易被 GCG 与消融打破。

    作者在八个开源指令模型上研究:同一有害意图从对话改由工具交付时,拒答为何变弱,内部计算是否也变了。。

    深度解读完整解读
已经到底了