跳到正文

全部动态

今日 0 条
10月1日周四
  1. Hugging Face Daily Papers ·

    一个 AI token 值多少?研究者为野生 AI 生成网页文本提出新缩放定律

    研究者发现,经 FineWeb 质量过滤后,2026 年 6 月网页数据中有 27.5% 的 token 被 Pangram 判定为 AI 生成,到 8 月升至 31.1%。这类野生 AI 文本来自多个模型、面向人类读者、在预训练语料中不带标注。为量化其影响,研究者预训练了 800 个语言模型,改变加入的 AI token 与人类 token 比例,并分别对人类文本和 AI 文本的留出损失拟合缩放定律。结果显示,对数据不足的模型,加入 AI token 起初会降低人类文本损失,但收益很快饱和并转为损害;对使用大量人类文本训练的模型,AI token 几乎立即抬高损失,而同等数量的新鲜人类文本仍能持续降低损失。该定律在小模型上拟合后,可预测最多 3.6 倍大的模型受 AI 文本影响的人类文本留出损失,误差比现有最佳定律低 41%。

  2. Hugging Face Daily Papers ·

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    Mid-Harness 在模型与 harness 边界采样并验证候选动作后再转发执行,生成器与 harness 保持不变。在 TerminalBench-Lite 上,GPT-5.6 Sol 验证器配合 8 个采样动作将 TMAX-9B 生成器的 Pass@1 从 50.00% 提升至 68.03%;弱验证下增加采样收益有限。将强验证器响应蒸馏回 TMAX-9B 可进一步提升 Pass@1,且动作与轨迹扩展结合比单独生成更多轨迹更省 token。

  3. Hugging Face Daily Papers ·

    PatchHolmes:基于列表式选择的智能体补丁检索系统

    PatchHolmes 提出让 AI 智能体一次性读取前 100 个候选提交并通过四个预算受限的工具逐一打开提交来定位漏洞修复补丁的方法,将 Recall@1 从逐点系统的 34.61% 提升至 59.95%。该系统无需微调和付费搜索 API,仅依赖冻结的开源权重模型运行于本地 Git 克隆仓库之上,单次处理约消耗 96000 输入 token、执行 8 次工具调用并阅读 5 个提交。

  4. Hugging Face Daily Papers ·

    SkillSeek:Agent 技能检索在 Marketplace 规模下的再审视

    SkillSeek 在 89 项任务的基准上对比 11 种检索方法,发现 1990 年代的 BM25 关键词匹配在 4 种设置中的 3 种追平或超过智能体式检索循环,小型 cross-encoder 在第四种设置以 0.442 通过率持平。每次运行成本为无技能 27.41 美元、该检索器 27.54 美元、智能体循环 51.30 美元,且该检索器在 CPU 上运行、不消耗任何语言模型 token。作者主张智能体式检索应作为兜底方案,标准检索流程才是首选;论文同时指出大技能池下第一阶段召回率会限制任何重排器的上限。

  5. Hugging Face Daily Papers ·

    Agent Error Dataset 发布 5 万条错误诊断配对,用于失败分析与错误感知后训练

    论文提出 Agent Error Dataset(AED),包含来自 9,961 个源任务、33 个环境、19 个 harness 家族和 23 个策略模型的 50,228 条错误诊断配对,并保留源轨迹与执行元数据以支持跨场景失败分析和重新诊断。作者用五阶段 Agentic Error-to-Training(AET)流程收集自然失败、生成诊断与修正建议,并对照记录证据进行核验。在 3,062 对匹配重放中,首次提出的修正把验证器通过率从 18.4% 提升到 51.1%,提高 32.7 个百分点。

  6. arXiv:Agent 与 MCP 安全 ·

    用进化方法为 Rocq 和 Lean 设计智能体/证明器接口,降低定理证明成本

    研究者提出一种进化方法,由前沿模型逐步提出新接口功能,只保留能提升小模型整体表现的部分,并据此培育出面向 Rocq 证明器的新 MCP 服务器 rme。在 miniF2F-Rocq 的留出 test 划分上,配备 rme 的智能体在来自两个模型族的四个模型上,成功率、单次求解成本和单次求解时间均优于仅暴露 Rocq 编译器的基线以及一个已有 MCP 服务器。该服务器虽为 Rocq 进化而来,却能迁移到 Lean,在 PutnamBench 子集上改善成本与时间,作者已开源 rme 及其 Lean 移植版。

  7. arXiv:对齐与欺骗 ·

    AutoMark:让自动研究流程自主发现更优 LLM 水印方案

    AutoMark 提出一套让自动研究流程自主发现无失真水印方案的框架,作者称这是首次实现水印方案的自主发现。框架包含三部分:设定水印可靠性的严格标准(例如避免异常高的假阳性率)、用统计检验自动判断方案是否满足标准,以及从可检测性、质量和鲁棒性三个维度对水印排序的评测套件。在 GPT-6 Astra、Opus 5、Gemini-3.8 Flash 三个前沿模型上运行后,共发现 50 多种水印方案,其中若干在所有关键维度上超过此前工作。作者还对发现的方案做人工分析,把关键思路拆解为更小组件并逐一研究各组件对三个维度的影响,并指出智能体除改进已有思路外也发现了全新思路,例如将水印分数与随请求变化的随机方向对齐。

  8. Help Net Security AI ·

    2026 年 9 月最热门的开源网络安全工具

    2026 年 9 月值得关注的开源安全工具包括:Sift 可在本地磁盘、Windows 文件共享、Active Directory、SharePoint、OneDrive、Teams、Slack、Jira 和 Confluence 中扫描密码与 API key;ToolHive 以 Apache 2.0 许可在容器内运行 MCP server;腾讯朱雀实验室的 AI-Infra-Guard 可识别 Ollama、vLLM、ComfyUI 等服务,比对 1,600 多个已知 CVE,并检查 MCP server 与 agent 技能、对目标模型做越狱评估。

9月29日周二
  1. arXiv:对齐与欺骗 ·

    PILLAR:面向增强检索的私有倒排索引词法查找

    PILLAR 是一种基于私有信息检索(PIR)的隐私保护 RAG(PPRAG)系统,客户端从服务器持有的公开语料中取回与查询最相似的 k 篇文档,而服务器无法得知查询词项及其访问模式。它采用稀疏加稠密两阶段混合检索:稀疏阶段对预计算 BM25 分数的索引发起少量固定次数的 PIR 查询筛出候选,稠密阶段仅取回候选文档嵌入向量并在本地重排,避免私有稠密检索所需的大量 PIR 查询。PILLAR-Bin 将倒排列表分箱进哈希表,单轮设计延迟低于现有方案;PILLAR-Tree 将 block-max 剪枝转为不经意树遍历并结合 cuckoo 哈希表,在更低延迟下取得最高检索质量。

9月28日周一
  1. arXiv:可解释性 ·

    REGEXROUTE:无需嵌入向量的正则表达式路由,兼顾速度与可解释性

    REGEXROUTE 用稀疏自编码器(SAEs)从无标注文本中发现可解释的正则表达式特征,让 LLM 将分组 SAE latent 的描述转成正则提取器并迭代精炼,从而在推理时完全省去神经编码。在四个基准上,固定 128 个特征取得 76.43% 平均路由准确率,与最强神经文本编码器基线的 76.41% 相当,且延迟更低、鲁棒性更强。该工作还发现 Qwen2.5 编码器从 0.5B 扩到 72B 参数对路由准确率提升甚微。

  2. arXiv:Agent 与 MCP 安全 ·

    HTN 规划作为多服务器 MCP 工具编排的协调层

    针对 MCP 仅允许 host 编排跨服务器工作流、由 LLM 编排时结果不确定且每次工具调用需一次推理往返的问题,研究者提出一种协调架构:由 HTN 规划器一次性生成可验证的跨服务器计划,再由运行时中间件在多个 MCP 服务器上确定性执行,并通过 ${context.X} 模板机制在执行时绑定跨动作数据依赖。该架构在实验室机器人、生物信息学和多尺度建模五个 HTN 域上实例化,从浏览器端计划控制器对八个在线第三方 MCP 服务器完成端到端执行。

9月27日周日
  1. Failure-First ·

    WCM:面向通用人机交互的世界认知模型

    陈等人提出世界认知模型(WCM),用 SLAK 架构将感知、逻辑、动作、知识四模块解耦,并采用异步运行时让推理、人机交流与物理执行并行。在 9 项真实物理交互任务上平均成功率为 73.8%,剩余 26.2% 未处理任务余量被作者视为红队测试的诊断入口。异步设计也带来延迟与状态失同步风险,机器人可能基于已失效的世界状态行动。

9月25日周五
  1. Trail of Bits Blog ·

    别让 TEE 破坏你的 MPC:TEE 与阈值签名结合的安全陷阱与最佳实践

    在 TEE 内运行 MPC 协议时,若未考虑不可信主机,恶意主机可在阈值签名者删除已用预签名后回滚文件系统状态,导致 nonce share 被重用并泄露私钥分片。TEE 的机密性、完整性与远程证明可把半诚实协议提升到恶意安全级别,但前提是将其视为纵深防御层而非健全协议的替代品。部署时需验证 quote 签名、证书链与测量值,并借助可复现构建和二进制透明日志绑定 MPC 参与方身份。

9月24日周四
  1. 腾讯 AI-Infra-Guard 版本发布 ·

    腾讯 AI-Infra-Guard v4.6.3 发布

    腾讯 AI-Infra-Guard 发布 v4.6.3,新增 DeepTeam 在运行期间将完成的测试用例写入磁盘,并修复 API Checker 对 Claude 5 签名的支持。该版本为 API Checker 补充失败指纹样本以提升模型识别可靠性,同时为 Prompt-Eval 加入限流感知退避、熔断器和进程组终止机制,并在熔断器与模型间共享限流计数器、加固 Retry-After 解析。文档方面新增 FORGE-Bench 与 RogueHandoff-20 研究条目并同步至 8 种语言 README。

  2. Goodfire Research ·

    Goodfire 用 Evo 2 嵌入实现 420 万个遗传变异的可解释预测

    Goodfire 与 Mayo Clinic 合作,基于基因组基础模型 Evo 2 的嵌入向量构建轻量分类器,对 839k 个 ClinVar 变异做致病性预测,整体 AUROC 达 0.997,优于现有方法。该方法覆盖编码与非编码区域,可泛化到留出数据,并借助可解释性工具生成机制性假设。团队通过 Evo Variant Effect Explorer(EVEE)公开全部 420 万个 ClinVar 变异的效果预测与假设解释,研究仍在同行评审中。

9月23日周三
  1. Failure-First ·

    受人类手术启发的机器人开颅框架:多模态融合与自适应轨迹调整

    针对现有机器人开颅多为"开环"系统、无法应对术中配准误差与颅骨位移的问题,研究者提出一套融合多模态感知与自适应控制的框架,用双轮廓融合轨迹规划配合球头工具单级螺旋铣削。其 CMA-TCN-Transformer 网络融合力信号与铣削声音,再经自适应贝叶斯滤波抑制误触发,并在检测到穿透后原位修正辅助轨迹。牛肋与离体羊颅实验显示,闭环系统在进度 ξ≥0.9 时将进给速度降至 vsafe=1mm/s。

9月22日周二
  1. arXiv ·

    onPanda:通过 token 级修正高效标注 LLM 与智能体的 on-policy 对齐数据

    onPanda 是一款用于标注 LLM 对齐数据与智能体轨迹的交互工具,核心交互是 token 级修正:标注者定位首个不当 token,从模型候选 token 中选取替换或自由编辑,系统截断其后内容并从修正前缀继续生成,循环"定位—修正—继续"直至满意。一项小规模对照研究显示,onPanda 将标注中位耗时较人工后编辑降低 52%。由于最终回复绝大多数 token 由模型自身生成,所得数据基本保留模型采样分布,适用于构建 on-policy SFT 与偏好数据,修正记录还提供带精确位置的正负样本对。

9月21日周一
  1. arXiv:对齐与欺骗 ·

    DeceptionAnalyser:基于论证方案与 LLM 的结构化欺骗分析网页工具

    DeceptionAnalyser 是一款浏览器端工具,用十种论证方案建模不同形式的欺骗,通过 LLM 提取前提、再以关键问题驱动评估的两阶段方法分析叙事文本中的欺骗推理。研究未做分类准确率基准,而是用十款当代大语言模型重复运行,测量前提与结论评估的一致性来检验方法可靠性,发现对明确欺骗的方案识别高度稳定,在更模糊的情报风格叙事上则以可解释的方式平缓退化。该方案库定位为标记可疑主张供审查,而非输出欺骗判定。

  2. arXiv:越狱与提示注入 ·

    综述提出智能体 AI 安全的跨维度威胁分类 T={S,B,P,A}

    一篇综述对 2022 至 2026 年间发表的 66 项研究做结构化梳理,提出跨维度表示 T={S,B,P,A},把受影响的系统面、交互或信任边界、被违反的安全属性与实证考察的架构关联起来。作者分析了 22 项有制品支撑的红队研究以及 11 个代表性安全基准,发现证据集中在提示词与推理、记忆和工具调用类攻击,且多为单智能体场景;持久化、人机交互、复杂多智能体、系统性和长时程威胁的覆盖较少。作者强调这些结论描述的是所选语料而非全部实证研究,并指出指标异构、自适应防御评估有限、架构分布不均和执行状态捕获不完整制约了可比性与可复现性,据此提出 13 个开放研究问题。

  3. arXiv ·

    SyzHarness:用 LLM 合成模糊测试 harness 复现 Linux 内核补丁漏洞

    SyzHarness 结合 LLM 推理与覆盖率引导模糊测试,从补丁出发复现 Linux 内核漏洞:LLM 智能体借助代码导航工具合成参数化 fuzzing harness,固定前置设置逻辑,只把不确定的 bug 关键输入参数交给 Syzkaller 变异,再通过分层可达性反馈迭代优化。在 100 个 KernelCTF 案例上复现成功率达 78%,在 SyzDirect 基准上达 73%,明显优于此前的定向灰盒模糊测试;对 2026 年 3 月后修复的 50 个 syzbot 已知可触发 bug,仅凭修复提交即复现 40/50(80%)。

9月20日周日
  1. Failure-First ·

    URF:面向稳定接触操作机器人控制的统一策略与控制框架

    Jiyou Shin 等人提出统一机器人控制—策略框架 URF,让高层策略预测底层执行模式而非仅输出运动目标,从而弥合刚性接触场景中的执行断层。该框架在每个动作步预测含虚拟目标、刚度矩阵与阻抗—导纳切换比的动作块,并用实测外力大小作为环境刚度的代理信号来监督学习。在箱翻转基准中,纯力控基线成功率为 0%,自适应柔顺控制器 ACP 为 25%、临界失败率高达 86.7%;完整版 URF 将峰值力增长率从 48.5±15.5 N/s 降至更低水平并实现 0% 临界失败率,同时显著抑制振荡。

9月19日周六
  1. arXiv:对齐与欺骗 ·

    DeepSeek Elastic Compute(DSec):面向大规模智能体训练的高效沙箱基础设施

    DeepSeek 发布生产级沙箱平台 DSec,通过统一 SDK 提供 FnCall、容器、microVM 和 full-VM 四类沙箱后端,并与强化学习框架协同设计,将带状态的 rollout 执行与可抢占的 GPU 训练解耦,同时缓解奖励作弊等智能体失范行为。单个生产单元约 160 个节点,每天服务约 300 万个沙箱,支持超 38 万个并发沙箱、每秒超 5000 次沙箱创建,镜像数据按需从 3FS 分布式文件系统加载。

  2. arXiv:Agent 与 MCP 安全 ·

    可信智能体 AI:基于 LLM 的自主系统失效模式、缓解策略与 TADL 生命周期框架

    一篇 arXiv 综述梳理了基于大语言模型的智能体 AI 在安全与运维上的五类可信维度:安全与鲁棒性、对齐与人类监督、透明度与可审计性、隐私与数据治理、监管合规。文章把间接提示注入、后门触发、目标泛化错误、记忆污染和跨会话数据泄露等失效模式归入统一分类,并评估指令层级、上下文隔离、spotlighting、过程监督、受限工具使用和隐私保护记忆等缓解手段,区分有实证支持与仍属概念性的方法。作者据此提出六阶段 Trustworthy Agent Development Lifecycle(TADL),覆盖规格、设计、训练、评估、部署与监控,但该框架尚未经实证验证。

  3. Failure-First ·

    RL-MACRO:部分可观测下颅骨切开机器人自主磨骨的多模态自适应控制

    Zhang 等人提出 RL-MACRO,一套基于离线强化学习的闭环控制框架,通过融合力与声音信号重建无法直测的工具—组织界面状态,实现颅骨切开术中安全的自主磨骨。该系统用因果 1D-CNN 加 LSTM 从 6-DOF 测力计与麦克风估计温升 ΔT,并用隐式 Q-learning(IQL)驱动切割深度与进给转速的双头策略,避免在线试错风险。在未见样本上温度预测的决定系数 R² 达 0.939,平均绝对误差 1.717°C,牛肋铣削实验进一步模拟皮质骨与松质骨的层间过渡。

9月18日周五
  1. arXiv:对齐与欺骗 ·

    基于泊松过程的可水印多草稿推测采样

    针对推测采样与水印难以兼得的问题,研究者提出一种基于泊松过程的多草稿推测采样算法,可在不降低推测接受率的前提下嵌入无偏水印。该算法基于精确的免通信列表耦合方案,具备草稿器不变性,是首个同时保持水印强度与采样效率的多草稿、草稿器不变推测采样方案,实验验证了两方面性能。

  2. Trail of Bits Blog · 67

    Trail of Bits 用 AI Agent 自建工具链审计 Miden zkVM

    Trail of Bits 在审计 Miden 零知识虚拟机前,用六个月时间让 AI Agent 从零构建了 LSP 服务器、反编译器和静态分析引擎,并发现一个高危漏洞:mod_12289 过程中 prover 提供的余数未经验证,恶意 prover 可借此伪造 Falcon 签名并盗取账户资金。

    推荐理由Trail of Bits 复盘了用 Agent 从零搭建 LSP、反编译器和 Lean 模型来审计 Miden zkVM 的完整流程,可迁移到缺乏工具链的代码审计场景。

9月17日周四
  1. 腾讯 AI-Infra-Guard 版本发布 ·

    腾讯 AI-Infra-Guard v4.6.2 新增 FORGE-Bench 失控基准

    腾讯 AI-Infra-Guard 发布 v4.6.2,新增面向自主智能体的确定性失控基准 FORGE-Bench(forge_bench)及干净的 RogueHandoff-20 基准,并补充一批 AIG 检测规则。该版将 aig-skill-scan 升级到 0.2.2,减少无证据误报、避免模型工具调用卡死并约束流式中断响应,同时修正判定与公开结果的比对逻辑。Extract-Vuln 模块剥离 CDATA 包装并兼容常见标签别名,另清理了 12 处 YAML 校验失败等问题。

  2. Failure-First ·

    ReferTrack:具身视觉跟踪中先用显式指向再解码路径

    针对当前 Vision-Language-Action(VLA)模型的抽象空间隐变量难以监督、失败原因无法归因的问题,研究者提出 ReferTrack,将具身视觉跟踪拆解为先从候选目录中用单个 Refer-CoT token 选出目标索引、再由 TVBI token 维持目标的显式流程。该框架基于 Qwen3-4B,搭配 YOLO11 加 ByteTrack 检测器和 SigLIP/DINOv2 双编码器,仅用单目前视摄像头就在 EVT-Bench 取得 SOTA:Single-Target Tracking 成功率 89.4%、Distracted Tracking 73.3%。

  3. arXiv:越狱与提示注入 ·

    RWPS:面向网络安全博弈的高效纳什均衡计算

    针对博弈收益只能由模拟器输出、均衡求解受收益估计瓶颈限制的问题,研究者提出 Regret-Weighted Payoff Sampling(RWPS),把固定模拟预算集中用于均衡真正依赖的收益,并用已测收益训练模型预测其余收益。该方法给出按对手均衡策略加权收益误差的界,在三个合成一般和博弈(含 Colonel Blotto)上比标准界紧 4 至 6 倍,并在同等预算下比 minimum-regret-first search、information-gain search 和 progressive sampling 找到更不易被利用的均衡。

  4. NVIDIA NeMo Guardrails 版本发布 ·

    NVIDIA NeMo Guardrails v0.24.1 发布

    NVIDIA NeMo Guardrails 发布 v0.24.1 补丁版本,集中修复若干缺陷。该版本修正了 benchmark 中 Locust 并发测量与扫描、content-safety 对 Nemotron 3.5 响应的解析、server 在 IORails 准入丢弃时返回过载响应,以及 rails 对组合配置加载 config.py 的问题。

9月16日周三
  1. arXiv:Agent 与 MCP 安全 ·

    PentestChain:面向免费层 LLM 的成本感知 MCP 编排自动化渗透测试框架

    PentestChain 是一个十阶段自动化渗透测试框架,通过成本感知的 AI 级联(本地 Ollama qwen2.5-7b 优先,其次免费层 OpenRouter 与 Cerebras,并带规则回退)在零付费 API 成本下实现端到端运行,并以 MCP 服务器暴露 11 个工具。该框架基于 2025 年 MCP 事件记录(mcp-remote 的 CVE-2025-6514 远程代码执行漏洞、postmark-mcp 供应链后门及工具投毒类攻击)建立四位置威胁模型并提出四项缓解措施。

  2. arXiv:对齐与欺骗 ·

    Open-1B:一次完全可审计的训练运行

    作者提出一种新的模型透明度层级“完全可审计”,让训练中每个数据样本上的每一步操作都能在异构消费级硬件上以位级确定性独立复现。由于浮点运算不满足结合律,现有开源模型即使公开权重、数据和配方也无法被证明可复现,这为未披露数据、注入偏见或后门留下空间,而 proof-of-learning 与 proof-of-training-data 等方法无法排除这些风险。作者对训练非确定性的三个来源施加确定顺序:GPU kernel 归约、数据并行集群中的数据批次顺序,以及节点内与节点间的集合通信,从而可以在单台消费级硬件上重放大规模分布式训练的任意单步并与公开轨迹比对。

9月15日周二
  1. MITRE ATLAS 数据发布 ·

    MITRE ATLAS 发布 v2026.09 数据更新,新增多项 Agent 与多模态攻击技术

    MITRE ATLAS 发布 v2026.09 数据版本,包含 1 个矩阵、16 项战术、120 项技术、88 项子技术、40 项缓解措施和 73 个案例研究。新增技术涵盖多模态输入中的触发器、AI Agent 响应偏置、伪造 AI 助手链接、配置错误或公开暴露的 AI 服务、发现 AI Agent 运行时能力、AI 定向隐蔽以及针对 AI 基础设施的主动扫描等。更新了 LLM 提示混淆、间接 LLM 提示注入、LLM 越狱、LLM 响应渲染和 AI Agent 点击诱饵等技术。缓解措施新增 AI 蜜罐,更新生成式 AI 护栏。