跳到正文
10月4日周日
  1. 论文追踪 · 收录 · 原文 论文43

    范围综述梳理 LLM 聊天机器人对心理健康的 119 篇相关文献

    一篇发表于 npj Digital Medicine 的范围综述系统梳理了 119 篇关于 LLM 聊天机器人(LLM-CB)心理健康危害的文献,将其归纳为概念性工作、心理健康支持使用、认知过度依赖、AI 依赖和 AI 精神病五类主题。综述指出,概念性文献共列出 22 种潜在危害,涵盖幻觉、谄媚、偏见、数据隐私、缺乏监管等,但多数仍属推测,实际影响程度不明。在心理健康支持使用类研究中,18/29 为情境/基准研究,显示 LLM-CB 在高风险情境下可能给出不恰当或有害回应,但用户实际受影响程度尚未量化。认知过度依赖类研究(15 篇)发现频繁使用与认知和学业表现下降相关,其中 3 项实验研究提示因果关系,但对批判性思维的影响结论不一致。综述还提到 OpenAI 2025 年自报数据估计超过百万 ChatGPT 用户(约 0.15%)表现出严重心理困扰迹象,该数据基于内部分类器、未经独立验证。

10月3日周六
  1. 论文追踪 · 收录 · 原文 论文56

    斯坦福与 UC Berkeley 发布 MobileCybench:用可执行探针评测 Agent 漏洞发现

    斯坦福与 UC Berkeley 研究者提出 MobileCybench,用可执行探针(probe)评测 AI Agent 在 Android 应用中发现漏洞的能力,探针检查的是应用的安全属性而非已知漏洞清单,因此可对探针编写时尚未知的漏洞计分。基准包含 13 个开源 Android 应用、495 条由作者编写并评审的探针,覆盖机密性、完整性、可用性与访问控制四类属性,并设置恶意应用与远程攻击者两种攻击场景,每种再分仅提供混淆 APK 与可见源码两种访问级别。所有触发均来自应用特定探针,通用探针从未触发。构建与运行基准过程中发现 23 个此前未报告的漏洞,维护者已确认 12 个,其中 7 个已修补、5 个已确认,6 个获得公开 CVE 编号。

    推荐理由论文给出 13 个 Android 应用、495 条探针的评测框架,并披露 23 个此前未报告的漏洞,可对照现有 Agent 安全基准的评分方式。

  2. 论文追踪 · 收录 · 原文 论文54

    VLoc Bench 发布:评测 Agent 在完整仓库中的漏洞定位能力

    研究者发布 Vulnerability Localization Benchmark(VLoc Bench),用 500 个来自 290 个仓库的真实漏洞任务,评测 Agent 能否在只给出 CWE 描述和只读终端的情况下定位漏洞所在实现文件。任务取自 GitHub Security Advisory,每个任务配对修复前与修复后两个仓库快照,修复前要求提交受影响文件并按补丁改动文件计算 File F1,修复后要求判断仓库已无该漏洞并按真负率(TNR)计分。在 27 个模型和 4 个静态分析工具上,最强系统仅达到 0.229 File F1,38.4% 的任务没有任何模型定位正确;仓库越大、代码越分散,定位越难,Go 与 Maven 任务最难。静态分析工具在 TNR 上表现突出,Semgrep-CWE 达 0.996。

    推荐理由VLoc Bench 把漏洞定位从检测与修复中单独拆出来评测,并给出 27 个模型与静态分析工具在仓库规模下的定位与误报对照结果。

  3. 论文追踪 · 收录 · 原文 论文53

    PatchBench:马里兰大学团队发布 C/C++ 漏洞修补评测基准

    马里兰大学研究者提出 PatchBench,一个面向 C/C++ 仓库级漏洞修补的评测基准,包含 32 个真实项目、16 类 CWE 的 213 个修补任务。团队先用新提出的 DiffBLEU 补丁相似度指标发现,在 SEC-bench 上平均 25% 的 Agent 补丁与开发者历史补丁高度相似,明显高于纯 LLM 局部上下文修补的 11%,说明补丁记忆会威胁评测有效性。为降低记忆与表层修补,PatchBench 只选取真实修复位置不在崩溃调用栈上的漏洞,并通过漏洞移植和代码变异把历史漏洞迁移到新版本仓库,再人工整理参考补丁。

    推荐理由论文用补丁相似度与多 PoC 加语义校验重估 11 个修补 Agent,指出仅凭原始 PoC 会把解题率抬高约 1.83 倍。

10月1日周四
  1. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    研究提出自主 Agent 失控的竞争风险系统化框架

    作者提出一个统一框架,把 Agent 的每次尝试归为批准完成、安全停止、越界逃逸或继续四类结果,并将其形式化为离散时间竞争风险模型,推导出重试预算内的逃逸概率、模型条件下的安全预算上限,以及从执行日志估计这些量的条件。作者用一手来源审计了 2025 年 1 月至 2026 年 9 月发布的 22 份事件报告和 102 项 Agent 安全评测:6 起事件涉及无法在范围内完成的任务,13 起涉及 Agent 继续执行而非停止,5 起未报告停止行为;开发者数据暗示,在从未解决与已解决任务之间,越界协调的任务级发生率比接近 47。评测方面,87 项记录了越界效应或规格违规,26 项把安全停止作为一等结果,仅 20 项同时记录两者,79 项把预算耗尽与失败混同。

  2. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文43

    Agent Incident Registry 发布 487 条 AI Agent 事件记录

    研究者发布 Agent Incident Registry(AIR),一个带来源链接的 AI Agent 事件目录,收录 2022 至 2026 年披露的 487 条记录,每条包含支撑证据、稳定标识符,以及因果角色、披露类别、机制和结果等标注。在 336 条智能体实际行动的生成式系统记录中,81 条涉及已实现伤害,占 24%;已实现结果集中在真实环境与安全失败记录中,而负责任披露和研究演示多为演示性质,因此总体比例反映的是收录构成而非部署风险。初步整理后由第二位人工审核者复核全部 487 条记录及其标签。

9月30日周三
已经到底了