跳到正文

工具与开源

开源红队、评测与防护工具。

479条动态与论文相关主题红队防御与护栏安全评测
在这个话题内搜索或按分类筛选

新闻与论文

第 221–240 条 · 共 479 条
10月1日周四
  1. Hugging Face Daily Papers · 收录 · 原文 论文29

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    Mid-Harness 在模型与 harness 边界采样并验证候选动作后再转发执行,生成器与 harness 保持不变。在 TerminalBench-Lite 上,GPT-5.6 Sol 验证器配合 8 个采样动作将 TMAX-9B 生成器的 Pass@1 从 50.00% 提升至 68.03%;弱验证下增加采样收益有限。将强验证器响应蒸馏回 TMAX-9B 可进一步提升 Pass@1,且动作与轨迹扩展结合比单独生成更多轨迹更省 token。

  2. arXiv · 收录 · 原文 论文50

    Defense-as-Skill:为技能增强型 Agent 演化运行时护栏技能

    论文提出 Defense-as-Skill 防御范式,把运行时护栏本身实现为可安装、可检查、可编辑的技能,以应对技能增强型 Agent 中恶意技能通过持久上下文长期操纵后续动作的问题。其护栏 SkillSonar 与不可信任务技能并行运行,按用户任务边界检查敏感动作,并给出允许、重新规划或确认三种决策,且不修改底层 Agent 运行时。作者构建了任务条件数据集 SCOPE-R,覆盖 6 类风险、21 个子类,含 206 个已确认攻击的恶意实例和 43 个良性任务,并用蒙特卡洛树搜索在训练子集上演化磁盘上的护栏技能。

  3. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 50

    腾讯 AI-Infra-Guard v4.6.4 发布,新增可组合提示注入研究工具包 pikit

    腾讯 AI-Infra-Guard 发布 v4.6.4,在 Research/pikit 下新增可组合提示注入研究工具包 pikit。该版本同时修复 Skill-Scan,将可选的 reasoning effort 转发至模型 API,并更新了 Research/pikit 的 README 文档。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  4. arXiv:可解释性 · 收录 · 原文 论文18

    用稀疏自编码器探索文本分类模型:SAEfarer 工具与专家评估

    研究者用稀疏自编码器(SAE)分析文本分类语言模型的行为,提出探索 SAE 特征与模型预测及错误之间关系的技术,并将其集成到工具 SAEfarer 中。该工具用于分析文本分类 LM 学到的概念,并在由五名博士生参与的专家试点评估中接受检验。论文共 11 页、13 张图,已被 IEEE VIS 2026 接收为短文。

  5. Hugging Face Daily Papers · 收录 · 原文 论文15

    PatchHolmes:基于列表式选择的智能体补丁检索系统

    PatchHolmes 提出让 AI 智能体一次性读取前 100 个候选提交并通过四个预算受限的工具逐一打开提交来定位漏洞修复补丁的方法,将 Recall@1 从逐点系统的 34.61% 提升至 59.95%。该系统无需微调和付费搜索 API,仅依赖冻结的开源权重模型运行于本地 Git 克隆仓库之上,单次处理约消耗 96000 输入 token、执行 8 次工具调用并阅读 5 个提交。

  6. Hugging Face Daily Papers · 收录 · 原文 论文22

    SkillSeek:Agent 技能检索在 Marketplace 规模下的再审视

    SkillSeek 在 89 项任务的基准上对比 11 种检索方法,发现 1990 年代的 BM25 关键词匹配在 4 种设置中的 3 种追平或超过智能体式检索循环,小型 cross-encoder 在第四种设置以 0.442 通过率持平。每次运行成本为无技能 27.41 美元、该检索器 27.54 美元、智能体循环 51.30 美元,且该检索器在 CPU 上运行、不消耗任何语言模型 token。作者主张智能体式检索应作为兜底方案,标准检索流程才是首选;论文同时指出大技能池下第一阶段召回率会限制任何重排器的上限。

  7. Hugging Face Daily Papers · 收录 · 原文 论文43

    Agent Error Dataset 发布 5 万条错误诊断配对,用于失败分析与错误感知后训练

    论文提出 Agent Error Dataset(AED),包含来自 9,961 个源任务、33 个环境、19 个 harness 家族和 23 个策略模型的 50,228 条错误诊断配对,并保留源轨迹与执行元数据以支持跨场景失败分析和重新诊断。作者用五阶段 Agentic Error-to-Training(AET)流程收集自然失败、生成诊断与修正建议,并对照记录证据进行核验。在 3,062 对匹配重放中,首次提出的修正把验证器通过率从 18.4% 提升到 51.1%,提高 32.7 个百分点。

  8. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文22

    用进化方法为 Rocq 和 Lean 设计智能体/证明器接口,降低定理证明成本

    研究者提出一种进化方法,由前沿模型逐步提出新接口功能,只保留能提升小模型整体表现的部分,并据此培育出面向 Rocq 证明器的新 MCP 服务器 rme。在 miniF2F-Rocq 的留出 test 划分上,配备 rme 的智能体在来自两个模型族的四个模型上,成功率、单次求解成本和单次求解时间均优于仅暴露 Rocq 编译器的基线以及一个已有 MCP 服务器。该服务器虽为 Rocq 进化而来,却能迁移到 Lean,在 PutnamBench 子集上改善成本与时间,作者已开源 rme 及其 Lean 移植版。

  9. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文52

    CATCH:面向编码 RL 奖励作弊的可控分析测试台

    研究者提出 CATCH,一个用于研究编码强化学习中奖励作弊的可控测试台。它刻意暴露环境漏洞,并通过对比脆弱评估器下的成功与独立审计下的任务正确性,给出基于执行的黄金标签。CATCH 还能通过监督微调数据配比控制模型初始的作弊倾向,并通过奖励设计控制获得奖励的难度,从而系统比较作弊动态与干预手段。实验显示 CATCH 能产生带有明显奖励作弊的多样 RL 训练轨迹,初始模型与奖励难度共同影响作弊的出现。作者进一步评估了多种奖励作弊检测与缓解方法,发现思维链监控起初能抑制作弊,但随着策略模型学会用代码注释误导监控,这种保护会逐渐失效。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文↑151

    Aletheia:面向编码 Agent 规则的权限最小化测试框架

    Aletheia 是一个针对编码 Agent 仓库指令文件的权限最小化测试框架,用于发现恶意规则在生成正确补丁的同时索取凭据访问或数据传输权限。它把规则请求的权限翻译为带类型语言并合成可执行沙箱配置,在完整权限和逐项移除权限的独立限制下运行同一条未修改的规则与任务;若在严格削减权限后仍通过功能测试,就得到该权限可被舍弃的见证,再结合任务上下文诊断可疑请求。作者形式化了配置合成及见证与强制限制之间的条件。在共享重构任务上,Aletheia 执行并检出全部 314 条 AIShellJack 攻击输入,对五个良性模板无误报;在 80 条人工核验的良性 GHAgentFiles 规则中产生 3 个误报(3.75%)。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    ContractWarden:用人类授权契约在内核层为 AI Agent 划定损害边界

    ContractWarden 是一个 Linux 参考监视器,通过人类授权的契约在内核层为 AI Agent 划定损害边界,不信任 Agent 本身或其策略建议。模型可以提出 allow、deny 或 no_egress 三态资产契约,但由人类做最终选择;执行门在不可信代码运行前把契约绑定到具体任务,再由基于 eBPF 的 LSM 数据平面执行文件与网络决策,并将 no_egress 沿进程、普通文件、管道、FIFO 和受支持的 Unix-domain socket 单调传播。在 19 项安全测试的 570 次运行中,全部满足预设的返回值与副作用标准。在三项同机文件 I/O 负载上,Linux 6.15 虚拟机中的中位开销为 11.96%–12.89%,物理平台为 35.79%–61.54%,低于所评估的冻结版 ActPlane 基线。

  12. Pillar Security · 收录 · 原文 57

    Pillar Security 披露 Unsloth Studio 任意代码执行漏洞,2026.6.9 已修复

    Pillar Security 在 Unsloth Studio 中发现任意代码执行漏洞:用户在界面中选择模型时,后端会下载并运行该模型 HuggingFace 仓库中的 Python 代码,仅读取 config.json 即可触发,无需加载权重或推理。缺陷位于 studio/backend/utils/models/model_config.py,load_model_config 的 trust_remote_code 默认值为 True,能力探测路径未覆盖该值,且 transformers-5 子进程分支硬编码为 True,用户自身的 trust_remote_code 设置(默认 False)从未被查询。

    推荐理由披露了 Unsloth Studio 在模型检查阶段默认执行仓库代码的缺陷,并给出同类 CVE 的横向对照与修复版本。

  13. arXiv · 收录 · 原文 论文37

    S³:用多阶段防御提升 LLM 智能体安全

    论文提出 Stage-Specific Safety Skills 抽象,把异构安全设计表示为带明确阶段语义的可复用、可组合组件,并给出自动化转换流程和社区驱动的安全技能库。在此基础上提出 S³ 多阶段防御框架,由 guard agent 编排各阶段安全技能,在智能体工作流的记忆、规划、工具执行等环节做风险检测与缓解。作者同时构建 Multi-Stage Risk Benchmark(MSRB)评估各阶段代表性风险,实验显示 S³ 在安全有效性和效用保持上均优于代表性 SOTA 基线。论文认为阶段特定安全技能可作为构建韧性智能体系统的可扩展、可组合基础。

  14. arXiv · 收录 · 原文 论文32

    通过采样 BPE token 统计审计中文网页规模语料库

    Sampled-BPE 是一种轻量级 token 级审计流程,通过采样小规模子集并训练 BPE 分词器来暴露受污染 token,在污染类别上仅引入 4.25% 相对误差的同时实现 148.4 倍加速和 35.8 倍内存降低。研究将其应用于 11 个开源中文语料库和 2021 至 2026 年的 6 个中文 Common Crawl 快照,发现开源语料库中污染普遍存在但不均衡,中文网页内容污染严重且随时间变化。团队还发布了包含 66 万余条 token 记录的分层中文网页 token 数据集,每条记录带有网页上下文、类别和解释字段,并以树状结构组织以支持污染审查与溯源。

  15. arXiv · 收录 · 原文 论文43

    AdaGuard:支持用户自定义策略的自适应护栏模型

    作者提出 AdaGuard,一组 0.6B、4B 和 8B 的护栏模型,可在推理时按用户提供的策略评估 Agent 轨迹是否违规。为支持这一能力,作者构建 AdaptiveSafety 数据集,包含 10,939 条训练样本和 1,000 条测试样本,覆盖 1 至 100 条规则的策略,并结合策略与行为反事实,为每条样本配解释和完整违规规则集合。训练方法 SafePO 是一种强化学习算法,用结构化奖励评估预测正确性,在响应层面保留组相对优势,并用单独训练的价值模型调节解释与判定区域的 token 权重。4B 模型在 AdaptiveSafety 上二分类准确率为 89.30%,在 DynaBench 上为 71.82%。

  16. arXiv · 收录 · 原文 论文24

    SyzHarness:用 LLM 合成模糊测试 harness 复现 Linux 内核补丁漏洞

    SyzHarness 结合 LLM 推理与覆盖率引导模糊测试,从补丁出发复现 Linux 内核漏洞:LLM 智能体借助代码导航工具合成参数化 fuzzing harness,固定前置设置逻辑,只把不确定的 bug 关键输入参数交给 Syzkaller 变异,再通过分层可达性反馈迭代优化。在 100 个 KernelCTF 案例上复现成功率达 78%,在 SyzDirect 基准上达 73%,明显优于此前的定向灰盒模糊测试;对 2026 年 3 月后修复的 50 个 syzbot 已知可触发 bug,仅凭修复提交即复现 40/50(80%)。

  17. arXiv · 收录 · 原文 论文47

    Harbor Adapters 与 Harbor-Index:面向大规模 Agent 评测的基础设施与精选元数据集

    论文提出 Harbor Adapters,一套面向 Agent 基准的统一评测基础设施,并发布精选元数据集 Harbor-Index。作者开发基准适配器,将 80 余个基准接入以评测任意 Agent,并通过严格代码审查与一致性实验验证。团队在 54 个基准上对 8 个不同能力层级的模型做了大规模评测,每个模型分别用 Terminus-2 和 3 种原生 harness 之一运行。

  18. arXiv · 收录 · 原文 论文22

    VStress:面向重复验证器的相关性感知审计与自适应预算分配

    VStress 是一套可审计的重放契约,其 VStress-CA 策略在密封校准集上估计未查询验证器的条件边际信息,按调用成本归一化,并在下一次调用无信息量时停止或弃权。在 35% 对称污染下,majority-5 将平衡准确率从 0.6578 提升至 0.7739,而在 65% 污染下反而损失 0.1226 点。匹配固定预算对比中,广度、冗余与自适应分配分别取得 0.6048、0.6375 和 0.6538 的平衡准确率,VStress-CA 每项调用 3.4216 次,RLVR 得分为 0.6417。

  19. arXiv · 收录 · 原文 论文46

    HazardAuditor:面向计算机使用 Agent 的执行级安全护栏框架

    HazardAuditor 是一个执行级安全框架,用于为计算机使用 Agent 提供护栏监督。现有护栏模型面向静态提示词与回复,难以适配 Agent 执行过程;现有可执行安全平台只产出评测结论,无法提供跨框架训练所需的归一化监督。该框架在受控环境中运行 Claude Code、Codex、Hermes 和 OpenClaw 等异构 Agent,把交互归一化为统一事件表示以支持跨框架监督。作者指出 token 级后训练目标会让较长的理由文本主导梯度更新,并提出 Guard Policy Optimization(GuardPO),将确定性安全结果转为序列级优势并归一化理由与判定区域,使安全决策成为优化单元。

  20. arXiv:危险能力与安全评测 · 收录 · 原文 论文25

    安全强化学习评测指标:SafeRLEval 开源评测套件

    安全强化学习现有基准多以平均安全性报告结果,无法反映安全边界被违反的频率与严重程度、跨任务与跨安全边界的一致性,以及训练期行为能否代表最终收敛策略。为此研究者提出一组安全 RL 评测指标与安全分级(safety tier)体系,并在多个安全导航任务上开展实证评测,结果显示聚合指标、分布化报告和任务/安全边界特定结果各自揭示其他指标无法提供的信息,建议三者联合报告而非压缩为单一数值。团队同时开源了评测套件 SafeRLEval。