跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 3 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 284 篇还没打标签,不在筛选结果里。

另有 284 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.05637

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    发表
    测试
    Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个

    摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。

    深度解读完整解读
  2. 防御arXiv 2610.00850

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体

    发表
    测试
    Qwen3.5-4B、Muse Spark 1.3、DeepSeek-V4.1-Flash 等 11 个
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    深度解读完整解读
  3. 防御arXiv 2609.39102

    论文提出 CrossFit 缓解自演化搜索智能体的共谋作弊

    提出 CrossFit,用折外求解器缓解自进化搜索智能体的共作弊

    发表
    场景
    AI Agent
    测试
    Qwen3.5-4B、Qwen3.5-9B
    摘要CrossFit 切断同源伪标签回流到提议者奖励的路径,并提高七个搜索基准上的 Cover-EM。

    False Frontiers 诊断自进化搜索智能体中的 co-cheating,并用按来源交叉拟合的反馈来缓解它。

    深度解读完整解读
已经到底了