跳到正文
今天10月8日周四
  1. arXiv · 收录 · 原文 日期未知论文53

    Open-MMUnlearning 发布:统一多模态大模型遗忘方法与评测框架

    研究者提出 Open-MMUnlearning,一个开源可扩展框架,通过共享接口和结构化配置整合目标模型准备、多模态数据处理、遗忘与评测。框架覆盖隐私、安全、版权三类共五个基准,支持四个模型家族的八个 MLLM 和十二种遗忘方法,评测套件同时考察遗忘效果、保留效用以及对模型干预、对抗输入和成员推断攻击的鲁棒性。在统一评测协议下比较十种代表性遗忘方法,GD 与 MIP-Editor 总分并列最高,GD 的遗忘质量最好,MIP-Editor 保留的模型效用更多。作者还提出指标元评测协议,用受控知识暴露的模型检验忠实性,并在量化和再学习条件下检验鲁棒性;在评估的十三个指标中,BLEU 的综合可靠性得分最高,KS-Test 的忠实性 AUC 最高但鲁棒性较弱。

  2. arXiv · 收录 · 原文 日期未知论文45

    CARE:为视觉-语言-动作模型推理加速提供认证式选择

    研究者提出 CARE,一种带认证的加速器选择方法,用于避免视觉-语言-动作(VLA)模型推理加速带来的任务失败。该方法通过相同初始条件下的配对 rollout,定义参考策略成功而加速策略失败的加速诱发失败,并在校准集上给出有限样本保证,使这类失败风险低于用户设定的预算;它部署通过认证的最快候选,若无候选合格则回退到参考策略。在四个 LIBERO 套件与 OpenVLA-OFT 上,CARE 认证了 9.0 至 10.8 倍加速,并以 95% 置信度保证至少 85.8% 的参考可解回合被保留;在严格预算下,无保证的选择器最多在 75% 的试验中超出预算,而 CARE 保持在预算内,其序贯形式比穷举评估少用 78.9% 的 rollout。该方法还适用于 π0.5 的流步数削减,以及 Crafter 中的 Qwen3.5-9B 和 Llama-3.1-8B 智能体。

  3. 论文追踪 · 收录 · 原文 论文39

    研究团队用 LLM 分析 570 万条 Reddit 帖,构建 AI 危害分类体系

    研究团队提出一套 LLM 辅助的主题分析管线,从大规模社交媒体数据中动态检测、分类和追踪新出现的 AI 危害。他们分析 18 个月(2025 年 1 月至 2026 年 6 月)内 570 万条 Reddit 帖子摘要,整理并发布包含 57.5 万条 AI 危害相关帖子的数据集,以及一套由 12 个类别、47 个子节点构成的自下而上 AI 危害分类体系。该分类体系能覆盖已有专家定义的风险,同时发现自上而下框架忽略的细粒度危害,例如不同形式的 AI 隐私侵犯。时间分析还揭示出以用户为中心的危害演变,包括智能体隐私与安全泄露、职场中的 AI 过早采用,以及 AI 伴侣停用带来的失落感。研究者称该管线缩短了危害检测周期,有助于推动更具参与性和响应性的 AI 治理。

  4. Hugging Face Daily Papers · 收录 · 原文 论文48

    WebFovea 提出视觉网页智能体四阶段加固框架,WebRetriever 挑战赛得分从 31.0 升至 57.0

    WebFovea 是一个视觉网页智能体,在 WebRetriever Challenge 2026 中以 57.0 分(满分 100)获得第二名。该挑战基于 WebRetriever 基准的 Protocol III,要求智能体从实时网站入口 URL 出发,操作网站自身界面并返回可验证答案。作者认为多模态大语言模型是必要条件但不充分,模型决策需经 harness 传递到浏览器,每一步有四个环节必须正确:模型回复被解析为预期动作、动作在页面上生效、结果被准确回报、模型看到所需信息。在真实网站上观察到的许多失败发生在这些环节而非模型推理,例如坐标空间不匹配导致每次点击落在目标坐标的 3/4 处,原生下拉框、iframe 内和文本框中的操作静默失败,自生成的 chat-template token 污染了 4.9% 的任务回合。代码已开源。

  5. Hugging Face Daily Papers · 收录 · 原文 论文40

    nanoMuse 发布开源个人智能体,跨设备共享对话并内置 Sentinel 动作审查

    nanoMuse 是一个以 GPL-3.0 许可发布的开源个人智能体,目标是在用户拥有的每台设备上运行同一个智能体,并让手机与电脑共享同一段对话。报告先以五个问题和三个时间尺度界定个人智能体,再依据 Meta 的公开记录和一份生产提示词副本分析 Meta 的 Muse 如何构建,并逐条标注来源。nanoMuse 通过任何人都可自建的 relay 共享对话,每个动作都经过 Sentinel 审查,记忆以用户可读的文件形式保存,模型由用户自行选择;其规模与成本以估算形式给出。开放记忆溯源、面向操作能力的评测套件以及配套开源模型被列为后续路线图。

10月7日周三
  1. arXiv · 收录 · 原文 论文↑156

    Transect:为长程 LLM Agent 评测保留可观测性的开源工具

    研究者发布开源包 Transect,用于在长程 LLM Agent 评测中保留可观测性。该工具基于 Inspect Scout 构建,用户在可复用的评测族配置中指定任务上下文与行为词汇,判分模型与分析设置另行提供。其可导航报告把记录事件、token 用量、子 Agent 活动与模型生成的行为标签对齐到同一按回合的时间线上,评审者可快速把握一次运行的脉络、把任一标签或事件追溯到来源回合,并导出底层数据表做跨运行分析。作者在一项生成近 1300 万 token 的 AI R&D 评测上演示了该流程,将 Agent 工作划分为与研究技能分类对应的行为阶段、子 Agent 委派与交互以及 token 使用;合并视图显示工作集中在操作性任务与稿件产出,几乎没有持续假设生成阶段的证据。

  2. Hugging Face Daily Papers · 收录 · 原文 论文42

    DAEDALUS:用自生成任务自举 Agent 记忆

    DAEDALUS 提出一种无需既有任务或 oracle 验证器、从自生成练习中自举可复用 Agent 记忆的方法。它让 explorer 智能体与环境交互生成有难度但可解的任务,solver 智能体尝试求解,每次失败后提炼启发式规则,只有 solver 在上下文中反复成功后才被接受,这些结果同时反馈给 explorer 调整后续任务难度,被接受的启发式规则汇入记忆库供测试时使用。在 AppWorld、τ^2-bench 和 AutomationBench 上,DAEDALUS 相比无记忆基线平均成功率最高提升 15.9 个百分点,pass^5 最高提升 2.2 倍,与使用训练任务的方法相当,推理成本低于多数方法。消融实验显示 solver 轨迹是提炼有效启发式的关键信息,且较小的探索预算即可带来性能提升,其启发式规则也能帮助其他模型族的智能体。

  3. Hugging Face Daily Papers · 收录 · 原文 论文42

    AGO AI Quality Gate:面向 RAG 的证据优先发布决策框架

    作者提出 AGO AI Quality Gate,一个用于工业级 RAG 评估的证据优先质量门框架,帮助企业在证据不完整、指标来自易出错 LLM 评审时决定系统版本是发布、修改还是拦截。框架包含四态决策模型(把缺失数据和评审错误作为显式结果)、结合确定性检查与本地护栏及结构化 LLM 评估的分层打分、用分层 beta-binomial 门概率化量化回归风险,以及强制性的元评估协议。由于项目数据为专有,作者在 RAGBench 的 12 个数据集、10 万条标注 RAG 轨迹上评估评审层:在相同分层测试样本(每个评审 N=1200)下,低成本评审 gpt-4.1-nano 检测不合规回答仅略高于随机(AUROC 0.603 [0.570, 0.634]),gpt-4o 达到 0.783 [0.756, 0.807],但其分领域表现仍在 0.62 至 0.88 之间。

  4. 论文追踪 · 收录 · 原文 日期未知论文49

    SBW:面向 LLM 智能体的语义行为水印方法

    研究者提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分桶替代公开簇分桶,在随机预言机模型下证明新桶分配不可预测。此前三种智能体水印方案都绑定精确动作符号,仅改写观测即可让 AgentMark 的比特恢复率降至 16.8%。在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench(每模型 600 条轨迹)在 1% FPR 下改写检测率为 0.49-0.66,精确符号方案为 0.05-0.17;ALFWorld(每模型 100 个回合)为 0.92-0.97 对 0.00-0.01。带密钥分桶把自适应伪造从 100% 降到假阳性下限。作者指出该保证不覆盖的边界:对抗者复制受害者自身步骤时,乱序拼接被中和(Qwen2.5-3B 上为 0.000),但链式重放在五个模型上仍达 0.76-0.98,作为开放问题报告。

  5. arXiv · 收录 · 原文 日期未知论文31

    面向大语言模型的参数内记忆增强综述

    一篇综述系统梳理了在部署阶段为大语言模型(LLM)增强"参数内记忆"的方法:把承载记忆的参数对象在推理时接入前向传播,以补充上下文学习(ICL)占用上下文容量、重复离散编码成本随上下文长度增长的问题。综述用两个正交维度组织该领域:参数放置位置(Embedding、Attention、FFN 层或 Hybrid)与参数获取时间(部署中在线获取 vs 部署前离线获取),并讨论了干扰、安全、与 ICL 协同设计及递归自我改进等开放方向。

  6. arXiv · 收录 · 原文 日期未知论文31

    NetAgent:面向多任务网络流量分析的智能体框架

    NetAgent 是首个用于多任务流量分析的智能体框架,无需任务特定训练即可完成复杂任务理解、动态分解编排与长时程分析。它包含知识增强的工作流规划、150+ 工具的动作空间、统一代码执行空间、三层记忆以及沙箱与运行时修复五项设计。在 9 个基准上,NetAgent 在几乎所有任务上超越 23 个单任务和 5 个多任务基线,对未见流量分布的 F1 达 90.04%,而最佳基线仅为 2.74% 和 3.04%。

  7. 论文追踪 · 收录 · 原文 论文53

    TRACE:仅凭 checkpoint 更新审计大语言模型有害目标

    研究者提出 TRACE,一种只读取 checkpoint 更新的权重审计方法,无需模型查询,也不需要接触未知的 SFT 数据。研究发现有害合规 SFT 会在 checkpoint 更新空间留下连续、依赖目标的排序:以纯有害合规、安全目标和良性效用三类 SFT 定义参考几何后,checkpoint 级坐标 s_H 能追踪受控的有害目标组成,在四个 7-8B 基座模型上 Spearman 相关系数为 0.986-0.992,更大模型规模上排序依然保持。对照实验显示该痕迹反映的是 SFT 目标而非有害输入暴露,也排除了有害样本数量或训练强度的简单解释。在分布偏移、未见数据、不同 SFT 配置、部分 checkpoint 访问以及 LoRA 与全参数微调下,该痕迹保持稳定,并与独立测得的攻击成功率正相关;在有害目标占比较低时仍有信息量。代码已公开。

  8. Hugging Face Daily Papers · 收录 · 原文 论文34

    Jev 预注册测试:智能体记忆何时该用选择替代抽取?

    一项预注册研究在 LoCoMo 与 LongMemEval 上测试智能体记忆:在 LoCoMo 的紧预算下,由类型化决策模型 Jev 单次调用选出的原始对话轮次,不劣于 LLM 抽取式记忆(单侧 95% 界为 -3.0 分,非劣效界为 -5 分),且写入成本低 3,061 倍。重排序收益随预算增大而缩小:保留 30 个候选中的 3 个时在 LoCoMo 加 17.4 分、LongMemEval 加 9.1 分,预算宽松时仅加 1.5 和 1.1 分,此时抽取式系统更准。相同上下文下 Jev 选择精度与 LLM 重排序器相当(非劣效界 -2.0),延迟仅为其三分之一,且优于多次调用的图遍历;重排序会降低正确弃答率。

  9. 论文追踪 · 收录 · 原文 论文36

    RA-Det:利用鲁棒性不对称检测 AI 生成图像

    研究者提出 RA-Det,一种基于行为而非外观的 AI 生成图像检测框架。该方法利用鲁棒性不对称现象,即自然图像在小幅结构化扰动下保持稳定的语义表征,而生成图像的特征漂移明显更大。作者给出理论分析,建立该不对称性与生成模型记忆倾向之间的下界关系,解释其跨架构普遍存在的原因。在 14 个生成模型上、对比 10 余种强检测器,RA-Det 平均性能提升 7.81%,且不依赖生成器指纹,可迁移到未见过的生成器。源代码已在 GitHub 公开。

  10. Hugging Face Daily Papers · 收录 · 原文 论文22

    从蒸馏私有健康记录中智能体发现血液生物标志物

    研究将 Clalit Health Services 逾 540 万患者记录蒸馏为已发布的评分工具:针对 13 种免疫介导疾病,在数据边界内训练图注意力网络预测候选 CBC 表达式的病例对照 AUC,仅发布训练权重。外部验证中,智能体发现的表达式较文献种子起点 AUC 中位数提升 4.18 个百分点,在三个独立队列中对三种前沿研究工具候选重排序多数优于其首选。

  11. 论文追踪 · 收录 · 原文 论文57

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    圣加仑大学等机构的研究者提出 AgentSpy,在隔离环境(Firecracker microVM)中从操作系统边界记录 Agent 及其所有子进程的系统调用与网络流量,不依赖 Agent 自身的轨迹记录。它提供两类确定性分析:可靠性分析把每次执行汇总为星形图,统计执行的命令、读写的文件和访问的主机,并计算多次运行的相似度与技能覆盖率;安全分析则用规则检查读取私钥、越界修改文件、运行不可信程序、连接不可信域名等禁止行为。在 SkillsBench 的 77 个任务、codex harness 与三个模型上,同一任务的重复运行比混入其他任务的运行更相似的比例为 92.2%;在三次运行均通过测试的任务中,18% 出现与任务无关的活动,7% 读取了评分文件,17% 未使用开发者提供的技能指引。

    推荐理由AgentSpy 在系统调用层记录 Agent 及其子进程行为,并给出可靠性分析与安全规则两套确定性分析,可对照其评测结果评估自身 Agent 的可观测性方案。

10月6日周二
  1. 论文追踪 · 收录 · 原文 论文52

    Inspect Robots:面向具身智能体评测的开源模块化框架

    研究者发布开源框架 Inspect Robots,用于开发和运行具身智能体的评测。该框架提供可定制、可复用的抽象来定义物理评测并分析结果,同时配套自动化完成评测搭建、执行与终止的基础设施。作者用它评测了六个基于前沿语言模型的策略的能力与安全性。框架发布后三个月内下载量接近 10 万次,论文投稿至 CoRL 2026 的 The Science of Physical AI Safety(SPAIS)Workshop。

10月5日周一
  1. 论文追踪 · 收录 · 原文 论文37

    SideKernel:面向 macOS 上 AI 编码 Agent 的 microVM 沙箱

    佐治亚理工的一项硕士安全实践项目提出 SideKernel,一个面向 AI 编码 Agent 的开源本地 microVM macOS 沙箱,目标是提升可用性。作者先做在线用户调研,发现不到 40% 的 AI 编码 Agent 用户会在沙箱中运行 Agent,并归纳出阻碍沙箱采用的主要可用性障碍。随后作者按五项纳入标准筛选市面上的沙箱,围绕调研得出的 23 项能力测试,将 SideKernel 与符合条件的沙箱做对比分析,结果显示只有少数沙箱与 SideKernel 类似,其中 Docker Sandboxes 与 SideKernel 在可用性相关能力上得分最高。论文的另一项贡献是梳理本地、开源、基于 microVM 的 macOS AI 编码 Agent 沙箱现有方案。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文28

    IACM-RL:面向动态意图波动下复杂工具调用的意图感知上下文管理与强化学习

    IACM-RL 框架通过 BeliefState 自生成上下文管理器主动追踪目标变化,并用结构化过期标记隔离被覆盖的参数,以分层意图驱动奖励加三项辅助损失优化策略。作者同时提出 DynamicIntent 流水线,覆盖 13 种细粒度意图波动场景并配套五维诊断指标。在 DynamicIntent、BFCL-V3 和 τ²-Bench 上,IACM-RL 显著优于基线,减少无限 API 循环与过期上下文错误,并提升域外泛化能力。

  2. 论文追踪 · 收录 · 原文 论文41

    研究者提出最小范数攻击集成,用鲁棒性曲线替代单一 ε 评测

    研究者提出一套统一的对抗鲁棒性评测框架,用覆盖 ℓ0、ℓ1、ℓ2、ℓ∞ 四种范数的最小范数攻击池和鲁棒性-扰动曲线,替代在单一扰动预算 ε 下使用 AutoAttack 等预设攻击集成的做法。作者指出,鲁棒性-扰动曲线可能在不同模型间交叉或以不同速率衰减,导致单一 ε 下的排名不稳定,且现有集成无法说明与最坏情况性能的差距,也无法系统控制攻击强度与评测成本的权衡。为此他们把评测形式化为前沿逼近问题,构造最小范数攻击集成,在可控查询预算下逼近攻击前沿,预算越大估计越紧。作者还定义防御前沿为各扰动规模下模型集合中的最高鲁棒性,并提出 Defense Optimality Index,按防御与防御前沿的差距排名,无需选定参考 ε。在 CIFAR-10 和 ImageNet 上,该集成在多数防御和各个预算档位上达到或超过 AutoAttack,且查询成本固定可控。

  3. 论文追踪 · 收录 · 原文 论文43

    论文提出提示注入的七组件结构化分析模型

    Jeremy McHugh 在 arXiv 发表论文,提出用七组件模型结构化描述提示注入,取代逐字记录攻击字符串的做法。模型包含载体、投递向量、隐藏方式、上下文破坏、权限提升、载荷和回传通道七个组件,其中五个属于攻击产物字段、两个属于环境字段。作者认为大语言模型会把不同自然语言表述编译为相同可执行动作,因此标注应追踪攻击者意图(工具目标、sink 与效果)而非表面措辞。该框架整合了 HOUYI 的载荷分解、Promptware Kill Chain 与攻击活动分类法,并把 ReNeLLM 等最小越狱框架视为受限子空间上的投影。论文给出标注规则、可直接映射到行业 CTI schema 的逻辑分析记录,以及 EchoLeak(CVE-2025-32711)和野外恶意软件 AI 规避样本等示例。

  4. 论文追踪 · 收录 · 原文 论文41

    研究提出人机审计协作框架 HAAC,并在对话购物 Agent 上验证

    研究者提出 Human-Agent Audit Collaboration(HAAC)工作流与系统,用于在 AI 审计中划分人与 AI 智能体的分工,让智能体承担探索、评估、报告和复核,同时在需要情境判断的环节保留人类监督。团队将该框架实例化到对话购物 Agent 上并开展两项研究:71 名审计员的实验显示,AI 辅助提高了攻击成功率并扩大了探索范围,同时也影响了后续攻击方式,并增加了审计员对 AI 生成评估与报告的依赖。对负责任 AI 从业者的访谈表明,可落地的审计需要覆盖范围可见、攻击轨迹可复现,以及对审计智能体本身进行评估。

  5. 论文追踪 · 收录 · 原文 论文35

    JEV 作为智能体轨迹安全评判器:与生成式 LLM 评判器的实证对比

    研究对比了类型化决策模型 JEV 与四个生成式 LLM 评判器在智能体轨迹安全分类上的表现,测试覆盖四个基准共 5,219 条轨迹。JEV 的基准平均正类 F1 为 77.8,高于最强生成式配置 GLM-5.2 的 74.1,有效结果覆盖率分别为 95.5% 和 94.4%。JEV 在 ATBench500 和 MCPHunt 上领先,GLM 在 R-Judge 和 TraceSafe 上领先;JEV 成功调用延迟中位数 0.99 秒,每次有效判断的 token 成本平均约 $0.000195。

10月2日周五
  1. arXiv · 收录 · 原文 论文12

    TESS:面向大语言模型数据选择的可扩展可迁移元网络需换损失函数

    针对将选择网络直接并入现有 MTS 目标会导致优化不稳定与泛化差的问题,研究者提出基于 Pointwise Value Matching(PVM)的数据选择框架 TESS,指出权重压制和对易学特征的持续依赖是其成因。该框架在大语言模型安全与定向指令微调实验中展现出跨数据集、从子集到完整语料以及从小模型到大模型的强迁移能力。

10月1日周四
  1. Hugging Face Daily Papers · 收录 · 原文 论文46

    一个 AI token 值多少?研究者为野生 AI 生成网页文本提出新缩放定律

    研究者发现,经 FineWeb 质量过滤后,2026 年 6 月网页数据中有 27.5% 的 token 被 Pangram 判定为 AI 生成,到 8 月升至 31.1%。这类野生 AI 文本来自多个模型、面向人类读者、在预训练语料中不带标注。为量化其影响,研究者预训练了 800 个语言模型,改变加入的 AI token 与人类 token 比例,并分别对人类文本和 AI 文本的留出损失拟合缩放定律。结果显示,对数据不足的模型,加入 AI token 起初会降低人类文本损失,但收益很快饱和并转为损害;对使用大量人类文本训练的模型,AI token 几乎立即抬高损失,而同等数量的新鲜人类文本仍能持续降低损失。该定律在小模型上拟合后,可预测最多 3.6 倍大的模型受 AI 文本影响的人类文本留出损失,误差比现有最佳定律低 41%。

  2. arXiv · 收录 · 原文 论文53

    Meerkat:跨大量 Agent 轨迹检测安全违规

    研究者提出 Meerkat,将聚类与智能体搜索结合,用自然语言描述违规行为并在大量 Agent 轨迹中定位稀疏失败。该方法不依赖种子场景、固定流程或穷举,通过结构化搜索和自适应调查有潜力的区域来发现违规。在滥用、失准和任务博弈等场景中,Meerkat 的违规检测效果显著优于基线监控器,并在一个头部 Agent 基准上发现大量开发者作弊行为,在 CyBench 上找到的奖励作弊案例比此前审计多近 4 倍。论文共 35 页、17 张图,作者为 Adam Stein、Davis Brown、Hamed Hassani、Mayur Naik、Eric Wong。

  3. arXiv · 收录 · 原文 论文8

    OLMo:加速语言模型科学研究

    为应对最强语言模型被专有接口封闭、训练数据与架构细节不公开的问题,研究者构建了真正开放的语言模型 OLMo。与以往仅发布模型权重和推理代码的做法不同,OLMo 同时公开了训练数据、训练代码与评估代码,以支持对语言模型偏见与潜在风险的科学研究的开展。

  4. arXiv · 收录 · 原文 论文22

    onPanda:通过 token 级修正高效标注 LLM 与智能体的 on-policy 对齐数据

    onPanda 是一款用于标注 LLM 对齐数据与智能体轨迹的交互工具,核心交互是 token 级修正:标注者定位首个不当 token,从模型候选 token 中选取替换或自由编辑,系统截断其后内容并从修正前缀继续生成,循环"定位—修正—继续"直至满意。一项小规模对照研究显示,onPanda 将标注中位耗时较人工后编辑降低 52%。由于最终回复绝大多数 token 由模型自身生成,所得数据基本保留模型采样分布,适用于构建 on-policy SFT 与偏好数据,修正记录还提供带精确位置的正负样本对。

  5. arXiv:可解释性 · 收录 · 原文 论文14

    REGEXROUTE:无需嵌入向量的正则表达式路由,兼顾速度与可解释性

    REGEXROUTE 用稀疏自编码器(SAEs)从无标注文本中发现可解释的正则表达式特征,让 LLM 将分组 SAE latent 的描述转成正则提取器并迭代精炼,从而在推理时完全省去神经编码。在四个基准上,固定 128 个特征取得 76.43% 平均路由准确率,与最强神经文本编码器基线的 76.41% 相当,且延迟更低、鲁棒性更强。该工作还发现 Qwen2.5 编码器从 0.5B 扩到 72B 参数对路由准确率提升甚微。

  6. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文42

    ACEA:面向红蓝队对抗的 LLM 协同演化测试平台

    研究者提出 ACEA(Adversarial Co-Evolution Arena),一个把可插拔红队适配器与蓝队适配器接到同一靶标 LLM 上、由 LLM judge 对攻防成功率打分的对抗协同演化平台。平台通过最小化的 HTTP 协议 ACEA Standard Adapter Protocol(ASAP)接入任意语言编写的红队或蓝队项目,只暴露该协议即可成为完整参与者。评测方法上,向靶标注入规范化的秘密作为可验证真值,以区分真实泄露与模型幻觉;即使防御拦截了攻击,也仍把攻击发给靶标,从而独立测量攻击的原始效力,得到每轮攻击强度与防御有效性的分解。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文46

    SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量

    这篇 SoK 重新审视智能体 AI 时代的越狱安全,围绕用户交互、规划与推理、记忆、工具使用和智能体间通信建立攻击与防御的统一分类,并提出安全、效用、效率三维评估框架,区分原生有害提示安全、对抗性越狱鲁棒性和智能体层面的安全结果。作者在统一智能体框架内对代表性攻击与防御做了受控实证研究,发现三点缺口:强原生对齐并不意味着能抵御对抗性越狱;防御效果高度依赖模型、攻击类型和组件,且可能带来过度拒答、效用下降和延迟的显著代价;最终回复的攻击成功率低可能掩盖中间环节已被攻破,规划、记忆和工具交互在最终回复被成功过滤时仍可能不安全。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文17

    Trace2ATT&CK:基于图的 eBPF 内核遥测到 MITRE ATT&CK 映射方法

    Trace2ATT&CK 通过 eBPF 采集内核级事件、将攻击者命令关联为溯源图并生成紧凑图表示,再用纯 LLM 提示与基于 ATT&CK 知识库的 RAG 映射到 MITRE ATT&CK,输出排序后的技术候选及理由。在 347 个 Linux Atomic Red Team 测试上使用本地部署的开源权重 LLM 评估,RAG 持续优于纯提示,溯源图显著优于原始遥测,且本地推理无需牺牲数据机密性。

  9. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文18

    RWPS:面向网络安全博弈的高效纳什均衡计算

    针对博弈收益只能由模拟器输出、均衡求解受收益估计瓶颈限制的问题,研究者提出 Regret-Weighted Payoff Sampling(RWPS),把固定模拟预算集中用于均衡真正依赖的收益,并用已测收益训练模型预测其余收益。该方法给出按对手均衡策略加权收益误差的界,在三个合成一般和博弈(含 Colonel Blotto)上比标准界紧 4 至 6 倍,并在同等预算下比 minimum-regret-first search、information-gain search 和 progressive sampling 找到更不易被利用的均衡。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文42

    综述提出智能体 AI 安全的跨维度威胁分类 T={S,B,P,A}

    一篇综述对 2022 至 2026 年间发表的 66 项研究做结构化梳理,提出跨维度表示 T={S,B,P,A},把受影响的系统面、交互或信任边界、被违反的安全属性与实证考察的架构关联起来。作者分析了 22 项有制品支撑的红队研究以及 11 个代表性安全基准,发现证据集中在提示词与推理、记忆和工具调用类攻击,且多为单智能体场景;持久化、人机交互、复杂多智能体、系统性和长时程威胁的覆盖较少。作者强调这些结论描述的是所选语料而非全部实证研究,并指出指标异构、自适应防御评估有限、架构分布不均和执行状态捕获不完整制约了可比性与可复现性,据此提出 13 个开放研究问题。

  11. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文8

    面向压缩与隐私的可扩展离散到连续信道模拟

    研究者提出一种离散到连续信道的精确与近似模拟方案,使用固定数量的随机样本,运行时间与信道和输入无关。该方法对每个候选目标分布生成一个或固定数量的样本,经潜在置换后用指数竞赛完成样本选择,可在样本数与压缩率之间灵活权衡;结合极化码与多级编码,将长块长处理扩展至 O(n log n) 时间。作者展示了其在随机 VQ-VAE 可变速率压缩,以及通过精确模拟高斯机制实现通信高效差分隐私分布式均值估计中的应用。

  12. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    Open-1B:一次完全可审计的训练运行

    作者提出一种新的模型透明度层级“完全可审计”,让训练中每个数据样本上的每一步操作都能在异构消费级硬件上以位级确定性独立复现。由于浮点运算不满足结合律,现有开源模型即使公开权重、数据和配方也无法被证明可复现,这为未披露数据、注入偏见或后门留下空间,而 proof-of-learning 与 proof-of-training-data 等方法无法排除这些风险。作者对训练非确定性的三个来源施加确定顺序:GPU kernel 归约、数据并行集群中的数据批次顺序,以及节点内与节点间的集合通信,从而可以在单台消费级硬件上重放大规模分布式训练的任意单步并与公开轨迹比对。

  13. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文18

    基于泊松过程的可水印多草稿推测采样

    针对推测采样与水印难以兼得的问题,研究者提出一种基于泊松过程的多草稿推测采样算法,可在不降低推测接受率的前提下嵌入无偏水印。该算法基于精确的免通信列表耦合方案,具备草稿器不变性,是首个同时保持水印强度与采样效率的多草稿、草稿器不变推测采样方案,实验验证了两方面性能。

  14. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文18

    DeepSeek Elastic Compute(DSec):面向大规模智能体训练的高效沙箱基础设施

    DeepSeek 发布生产级沙箱平台 DSec,通过统一 SDK 提供 FnCall、容器、microVM 和 full-VM 四类沙箱后端,并与强化学习框架协同设计,将带状态的 rollout 执行与可抢占的 GPU 训练解耦,同时缓解奖励作弊等智能体失范行为。单个生产单元约 160 个节点,每天服务约 300 万个沙箱,支持超 38 万个并发沙箱、每秒超 5000 次沙箱创建,镜像数据按需从 3FS 分布式文件系统加载。

  15. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文15

    DeceptionAnalyser:基于论证方案与 LLM 的结构化欺骗分析网页工具

    DeceptionAnalyser 是一款浏览器端工具,用十种论证方案建模不同形式的欺骗,通过 LLM 提取前提、再以关键问题驱动评估的两阶段方法分析叙事文本中的欺骗推理。研究未做分类准确率基准,而是用十款当代大语言模型重复运行,测量前提与结论评估的一致性来检验方法可靠性,发现对明确欺骗的方案识别高度稳定,在更模糊的情报风格叙事上则以可解释的方式平缓退化。该方案库定位为标记可疑主张供审查,而非输出欺骗判定。

  16. Hugging Face Daily Papers · 收录 · 原文 论文29

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    Mid-Harness 在模型与 harness 边界采样并验证候选动作后再转发执行,生成器与 harness 保持不变。在 TerminalBench-Lite 上,GPT-5.6 Sol 验证器配合 8 个采样动作将 TMAX-9B 生成器的 Pass@1 从 50.00% 提升至 68.03%;弱验证下增加采样收益有限。将强验证器响应蒸馏回 TMAX-9B 可进一步提升 Pass@1,且动作与轨迹扩展结合比单独生成更多轨迹更省 token。