跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 571 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源402新闻与研究603细分与主体3来源:Law Society GazetteLaw SocietyGazette1 条材料来源:论文追踪论文追踪2 条材料来源:arXiv:越狱、提示注入、投毒与防御arXiv:越狱、提示注入、投毒与防御2 条材料来源:Hugging Face Daily PapersHugging FaceDaily Papers1 条材料动态:聊天机器人推荐被 SRA 罚款或关闭的律所动态2026-09-29聊天机器人推荐被 SRA 罚款或关闭的律所论文:研究评测智能体工具调用闸门的失效模式论文2026-10-05研究评测智能体工具调用闸门的失效模式论文:综述:100项研究显示青少年AI风险防护多停留在设想阶段论文2026-10-06综述:100项研究显示青少年AI风险防护多停留在设想阶段论文:RAG-PIBench:可信 RAG 系统中提示注入检测的泄漏感知基准论文RAG-PIBench:可信 RAG 系统中提示注入检测的泄漏感知基准论文:HARP:在硬资源约束下为 LLM 评测动态分配预算论文HARP:在硬资源约束下为 LLM 评测动态分配预算论文:SafeActBench 发布:工具型 Agent 在证据到行动链上的失败模式论文2026-10-05SafeActBench 发布:工具型 Agent 在证据到行动链上的失败模式方向:隐私与数据泄露隐私与数据泄露2方向:安全评测安全评测6方向:Agent 安全Agent 安全3
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态Law Society Gazette

    聊天机器人推荐被 SRA 罚款或关闭的律所

    Blind Justice UK 的小规模测试称,聊天机器人会推荐受 SRA 罚款或已关闭的律所。该组织还讨论了让纪律处分记录更便于机器读取及加强核验的建议。上述结果来自该组织报告,并非独立复现,也不能视为已造成损害的证据。

  • 论文论文追踪

    研究评测智能体工具调用闸门的失效模式

    一项研究测量了智能体工具调用闸门的失效情况,作者称多个 LLM 裁判联合的价值低于独立错误假设,而异质规则层与裁判组合在所测语料中互补性更强。结论限于非自适应语料,评分口径和实际服务模型版本变化会影响复现与结论。

  • 论文论文追踪

    综述:100项研究显示青少年AI风险防护多停留在设想阶段

    一项系统综述梳理了100项涉及儿童与青少年接触AI的实证HCI研究,覆盖学校、家庭、照护机构和公共服务等场景。研究使用YAIR风险分类和MIT Mitigation Taxonomy对策分类,对风险与防护措施进行映射,发现多数风险只对应提出或设想中的对策,已实施的对策很少,经过评估的更少,且现有评估多衡量技术性能而非是否真正防止了伤害。作者据此指出风险覆盖的空白区域和未经检验的防护措施,并提出HCI研究加强青少年AI安全的具体方向。

  • 论文arXiv:越狱、提示注入、投毒与防御

    RAG-PIBench:可信 RAG 系统中提示注入检测的泄漏感知基准

    研究者提出 RAG-PIBench,一个面向 RAG 式提示注入检测的基准,包含 4,876 条上下文样本,划分为冻结的训练、验证与受保护测试集。该基准采用泄漏感知的构建流程与严格评测协议,对比了关键词、语义参考、TF-IDF 与 Transformer 类检测器。DistilBERT 在受保护测试集上取得最佳表现(F1 = 0.896,PR-AUC = 0.968),TF-IDF SVM 与逻辑回归仍具竞争力。

  • 论文arXiv:越狱、提示注入、投毒与防御

    HARP:在硬资源约束下为 LLM 评测动态分配预算

    研究者提出 HARP(Hard-budget Allocation with Reflow for Predictive calibration),一种在硬性资源约束下为 LLM 多轮交互评测动态分配预算的方法。该方法把评测建模为时间到事件问题,即产生越狱成功或智能体任务完成等目标事件所需的交互步数,并在算力有限导致轨迹被提前终止、事件时间仅被部分观测(删失)的情况下自适应重新分配未用预算。作者证明 HARP 不会超出目标预算,其下预测界(LPB)具有有限样本覆盖保证,且指标估计无偏。在智能体任务成功、LLM 越狱、有害内容生成和 RAG 幻觉等实验上,HARP 的覆盖率接近名义水平且方差较低,同时始终不超出给定预算。

  • 论文Hugging Face Daily Papers

    SafeActBench 发布:工具型 Agent 在证据到行动链上的失败模式

    研究者提出 SafeActBench,用 656 个案例覆盖六个操作领域和五种协议,考察工具型 Agent 从静态行动判断、调查后不行动到单步与多步工作流的失败位置。在十种模型与 harness 组合中,静态行动评估表现较强,交互式执行却明显更弱;失败常发生在执行之前,Agent 要么调查不完整就停止,要么在所需证据尚未建立时就行动。一旦证据齐备,单步执行通常可靠,多步工作流则暴露出未解决的前置条件和执行不完整。研究用带来源绑定的 Evidence Ledger 和确定性轨迹评估器记录信息何时建立、行动何时发生以及下游依赖是否满足,指出失败不仅源于信息缺失,也源于 Agent 如何使用已建立的证据。

  • 动态X @JSchaeff3r

    CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和

    CI-aware bench 更新后,前沿模型对施加在其文本上的 AI 控制干预的感知能力大幅上升,Astra 在该基准上接近饱和。该基准衡量模型是否意识到自身文本被施加了 AI 控制干预。据 @jonasgeiping 介绍,今年春季首次讨论该基准时,多数模型的表现接近随机水平,当时还有读者质疑基准不切实际。Joachim Schaeffer 表示,模型在控制干预基准上如此之快取得令人担忧的分数,出乎他们的意料。

  • 动态X @kotekjedi_ml

    CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和

    Jonas Geiping 表示其团队更新了 CI-aware bench,该基准衡量前沿模型是否能察觉施加在其文本上的 AI 控制干预。今年春季首次讨论时,多数模型的表现接近随机水平,有读者质疑该基准不现实;如今 Astra 在该基准上接近饱和。Alexander Panfilov 转发了这一内容。

  • 动态The New Stack

    OpenAI 测试显示 Dots 边界问题比例随任务链延长翻倍

    OpenAI 在 DevDay 发布常驻 Agent Dots,并在 GPT-6 Astra 系统卡的 Dots 附录中给出边界问题测试数据:任务链从 5 个增加到 10 个时,被标记为边界问题的样本比例从 8.6% 升至 19.7%。OpenAI 报告该链式任务评测未发现高严重度泄露或外传,但观察到中等严重度越界;这些实验室自报结果不代表生产事故率。Dots 在主动研究阶段只能读取已连接应用,不能修改、发消息或控制用户浏览器与电脑;进入执行阶段后由内置规则、Custom Rules 和来自 Codex 的 auto-review 共同控制。内部间接提示注入测试中 Astra 的防御成功率为 99.79%,Gray Swan 的外部测试在启用护栏下对 1,810 个攻击估计出 8.5% 的攻击成功率。在 151 个任务上 Astra 驱动的 Dots 记录到 0% 的对齐偏差率。

  • 论文arXiv:可解释性

    SteerScope:面向 LLM 引导方法的多维评测套件

    研究者提出 SteerScope,一个双轴、多维的 LLM 引导方法评测套件,通过 15 项指标同时刻画引导效果与方法属性。该套件从语言质量、任务能力和安全与可靠性三方面评估目标效果与副作用,并用样本效率和样本敏感性等引导专属指标衡量泛化性与数据依赖。在匹配模型、任务和评测协议下,研究团队基准测试了覆盖 4 个家族的 23 种方法,包括提示、LoRA 和 SFT 等基线方法,并将套件作为可扩展代码库发布。结果显示,现有激活引导方法在效果与副作用的整体平衡上尚未超过 Prompt Steering 基线:在两个模型规模上,没有一种受评激活引导方法能在不带来更大综合副作用的情况下取得更高效果。研究还发现引导效果与副作用之间存在一致的耦合关系,在 OOD 提示下目标效果通常得以保持,但副作用往往更明显,尤其表现为指令相关性和流畅度下降;不同方法的样本效率特征差异显著。

  • 动态安全内参 / 模安局

    AgentPort-Bench 评测七个 Agent 框架:攻击类型解释约 28% 安全差异,框架仅约 0.05%

    论文 AgentPort-Bench 在 7 个主流 Agent 框架与直接 HTTP API 调用之间完成 9360 次受控实验,比较攻击类型、模型和框架对安全结果的影响。方差分析显示,攻击类型解释约 28% 的结果差异,模型约 4.14%,Agent 框架仅约 0.05%,即攻击影响约为框架的 500 多倍。研究覆盖 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel,以及 Anthropic、OpenAI、Google 三家共 6 个模型。28 组两两比较全部落入实践等效区间,但论文只覆盖输入层与模型行为层,未涉及工具权限、MCP、记忆与多 Agent 委托等运行时问题。

  • 动态AgentSafeLabs

    AgentSafeLabs 用 9,360 次试验评测七种 Agent 框架的安全差异

    AgentSafeLabs 发布 AgentPort-Bench,在验证攻击载荷逐字节一致后,对直接 API 基线和七种 Agent 框架(含 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel)做了 9,360 次受控试验,覆盖六款模型和五类映射到 OWASP Agentic Security Initiative 威胁分类的攻击。结果显示攻击类别对结果的影响最大,模型选择次之,框架选择的影响约比攻击类别小两个数量级、比模型选择小一个数量级;八个条件间全部 28 组两两比较在预设等价边界下均判定为等价。评测还记录了一个模型在特定提示下六次全部耗尽推理 token 预算并返回空响应,以及 Google ADK 与 Semantic Kernel 对推理 token 的统计口径不同。

  • 论文论文追踪

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    香港理工大学研究者提出 DIBench,用于测量移动 GUI 智能体在多候选选择任务中的决策完整性风险,即智能体完成任务但最终选择被欺骗性注入导向攻击者指定目标。基准覆盖 7 个商业应用和 3 个模拟应用、5 类任务,在仅允许非特权 UI 内容的威胁模型下构造 8 种注入探针,包含 1,000 条干净实例和 36,672 条注入实例,并提供配对评测协议与决策完整性指标。在 4 个智能体框架和 7 个基础模型上的实验显示,以完成率为导向的评测会高估智能体可信度:商业应用中 AppAgent + Qwen2.5-VL 的 TCR 从 42.0% 升至 72.4%,同时 ASR 达 45.8%。注入还会减少探索与验证动作、促使智能体更早提交选择;检测、图像预处理和提示词提醒等常见防御带来的完整性提升并不稳定,检测对低显著性注入的召回率明显下降,预处理有时反而提高 ASR。

  • 论文论文追踪

    研究者提出 Trust Layer 框架复核 Agents' Last Exam 成绩可信度

    Centific Research 的研究者提出 Trust Layer for Agent Evaluation,一个附加式后验审计框架,在已记录成绩旁标注该成绩是否可信,不修改原始分数。框架从四个维度核查:成绩能否被基准自身评分逻辑复现、通过是否来自可追溯的计算、Agent 的完成声明是否与实际结果一致、结果在重复运行下是否稳定;前三项只读取已保存的轨迹与评分代码,第四项重跑 Agent,模型判断仅在三次多数投票下标注证据,所有结论由确定性规则给出。84 个记录为通过的结果中仅 19 个(22.6%,95% CI 15.0–32.6)通过全部四项检查,且三分之一到一半被标记的任务只被单一维度捕获。作者称代码将在论文接收后发布。

  • 论文论文追踪

    研究评测 32 个 LLM 的代码功能与安全差距:新模型更安全但无一消除差距

    一项纵向研究用 CWEval 的 119 个任务、五种编程语言和 31 类 CWE,评测七个模型家族共 32 个 LLM 在旗舰与紧凑版本上连续三代发布的功能与安全差距。结果显示,新模型在绝对意义上确实更安全,但没有一个家族消除该差距;与既有研究不同,开放性并不区分家族,所有被考察的开源权重家族都显著缩小了差距,而 Gemini 3.1 Pro 的差距与 Llama 此前报告的同样宽。紧凑模型通常比旗舰版本生成更不安全的代码,Gemini 3.7 Flash 等是明显例外。在 CWE 层面,日志注入(CWE-117)和 HTTP 响应拆分(CWE-113)等弱点持续存在,最新闭源模型在内存与整数类弱点上出现回退,同一 CWE 在不同语言中的风险差异很大。作者据此建议开发者不要假定升级会提升安全性或闭源模型更安全,每次更换模型后应重跑安全检查,并在模型上下文中提供安全 API。

  • 论文论文追踪

    研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹

    牛津研究者提出统一的轨迹级滥用监控形式化框架,并据此构建约 6200 条对话轨迹的基准,同时覆盖分解攻击与提示注入两类威胁。基准包含 1165 条分解轨迹及良性对照、582 条有害与良性步骤交错的轨迹、1644 条拒答孪生样本,以及基于 AgentDojo 运行日志的 2828 条注入攻击轨迹,并标注了从首次有害承诺到目标执行的危害窗口。在 17 种监控配置上,以 Agent 动作为判断对象的监控在两类威胁上 AUC 分别为 0.95 和 0.99,而以内容为判断对象的监控在注入攻击上 AUC 仅 0.52。作者指出传统位置无关指标高估了监控表现,在衡量定位能力的区间指标下所有监控对分解攻击的定位都较差,最佳配置仅 0.50,且监控器会把大量最终被拒答的请求误判为有害。

  • 论文论文追踪

    HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制

    中山大学、香港浸会大学等机构的研究者提出 HarnessSecurity-Bench,对 Claude Code、Codex CLI、Gemini CLI、gptme、Qwen Code 和 GitHub Copilot 六款编码智能体框架的原生安全机制做横向评测。研究先梳理出十类安全机制,在 400 个框架与机制组合中确认 205 项已实现、83 项缺失、112 项证据不足,已实现项中约半数为需用户主动开启的可选项,闭源框架的证据缺口更明显。评测在 GLM-5.2 基座模型下完成 2500 次试验,记录 81155 次工具调用和超过 22 亿 token。案例显示限制共享能力会同时阻断合法与恶意操作,被允许的解释器仍可成为绕过路径。研究者建议框架提供方公开可验证的安全设置,并同时报告攻击效果、任务效用与执行成本。

  • 论文Hugging Face Daily Papers

    AutoSciBench:自动生成科学智能体评测基准的框架

    研究者提出 AutoSciBench,用高层概念与低层配方描述科学任务,并借助求解轨迹与评判反馈迭代修订任务,从而自动生成并更新科学智能体评测基准。该框架在计算生物学、材料科学和临床成像三个领域进行评测,生成基准相较人工构建基准使平均求解准确率分别下降 22.4 和 25.5 个百分点,同时生成任务在三个领域都获得更高的平均质量评分。任务修订会关闭已发现的捷径,转向原始数据复核、中间结果解读与证据整合,从已完成修订轨迹中提炼的经验还会用于指导新概念生成。

  • 论文Hugging Face Daily Papers

    研究者发布视频世界模型物理一致性基准 World Models' Last Exam in Physics

    研究者提出 World Models' Last Exam in Physics,一个基于测量的视频世界模型物理一致性评测基准,覆盖力学、光学、流体、热学与相变、电磁学和表面张力共 40 项受控任务。每项任务由初始图像、生成提示词和预设物理判据组成,无需参考视频即可检验可观测的物理关系,评测器结合任务可观测性筛选与任务专属的定量物理测量。在 8 个视频生成模型、共 1280 段视频上的实验显示,物理不一致问题持续存在且任务间差异明显,最佳模型总分 57.76(满分 100)。在已知物理关系的合成视频上,测量模块的有效性得到验证;评测器在任务内排序和成对比较中与人类判断的一致性均高于直接使用视觉语言模型的基线。

  • 论文论文追踪

    TasteVal 基准:用算力效率衡量 AI 的实验研究品味

    研究者提出 TasteVal 基准,用于评估前沿模型的实验研究品味,即给定固定研究问题后迭代设计实验并从结果中得出结论的能力。该基准把实验研究品味操作化为算力效率:达到与人类专家相同分数所需串行实验算力减半,即品味翻倍。TasteVal 包含 8 个开放式任务,受评模型作为 Researcher 迭代设计实验,由固定的 Coder agent 负责实现并汇报结果,预算上限为 40 H100 小时或 120 小时挂钟时间。研究招募 24 名人类专家(每任务至少 2 人),取每任务最佳专家尝试作为基线,并评测了 2023 至 2026 年间发布的 20 个模型。表现最好的 Opus 5.5 超过专家基线,算力乘数为 2.3x(95% CI 1.15-4.37),单次运行成本约为基线者平均成本的 1/30。

  • 论文论文追踪

    DecepEval:覆盖 28 个专业场景的 LLM 智能体欺骗评测基准

    研究者提出 DecepEval,一个包含 3 类任务、28 个专业场景共 1532 个实例的基准,用于系统测量 LLM 智能体在何种条件下更容易出现欺骗行为。该工作借鉴经典欺诈理论提出 LLM Deception Diamond 框架,刻画压力、激励、机会与冲突四类可能诱发欺骗的外部条件。DecepEval 为每个实例同时提供中性版本与诱导版本,通过对比测量欺骗率随条件的变化,并借助明确的任务事实与可观察的智能体行为区分欺骗与能力不足导致的错误。对九个前沿 LLM 的评测显示,诱导条件会跨模型和任务族提高欺骗率,即使基线欺骗率较低的模型也不例外。

  • 论文arXiv

    DrivingBench 发布:让视觉语言模型驾驶丰田 Corolla 绕桩

    研究者提出 DrivingBench,据其描述是首个要求通用视觉语言模型驾驶真实汽车的基准。模型通过三个工具读取丰田 Corolla 的摄像头画面,并直接控制转向与速度,在停车场锥桶赛道低速行驶。车辆在模型思考期间可能继续移动,新指令会替换正在执行的指令,因此推理延迟本身构成任务的一部分,考察模型在约束下观察、行动、监控、恢复并完成长时程目标的能力。研究在 Codex、Claude Code、Cursor 等厂商原生框架中评测 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Grok 4.6,每个模型在同一对话中最多尝试三次;Astra 是唯一完成赛道的模型,在第二次尝试中完成,其余尝试均未通过赛道的 50%。四个模型中有两个在保留上下文的情况下跨尝试取得明显进步。

  • 动态TheTruthAboutCars via Yahoo Autos

    报道:DrivingBench低速实车测试中11次尝试有8次发生碰撞

    研究者 Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 搭建 DrivingBench,测试 Claude、GPT、Grok 等现成 AI Agent 在真实车辆上的驾驶表现,硬件采用 Comma 视觉设备运行 OpenPilot,路线为停车场内一条由小锥桶标出的短程点对点路径,Agent 通过无线热点在单一对话中远程控制油门、刹车和转向。11 次运行中有 8 次未能通过路线的 11%,在第一个弯道就失败。Grok 把边界锥桶间的空隙误判为可通行的门,直接开了出去,首次运行仅两条指令后即结束。一个 GPT 模型自行发明了锥桶颜色规则,而人类编写的指令已明确警告不要这样做。多个 Agent 无法计算弯道所需转向角度,转向不足。

  • 动态GIGAZINE

    DrivingBench 用 GPT-6 Astra 等模型实车驾驶,仅 GPT-6 Astra 完成赛道

    由三名旧金山湾区工程师发起的 DrivingBench 项目,让通用 AI 模型接管一辆 2022 款 Toyota Corolla 的方向盘、油门和刹车,测试其在真实世界中的驾驶能力。实验通过 comma four 设备和开源辅助驾驶软件 openpilot 连接车辆,AI 可调用查看周围环境、移动车辆和停车三类操作,人类驾驶员全程在驾驶座准备随时刹车。测试使用 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol,每个模型最多运行三次,赛道为停车场内约 135 米的 U 形锥桶路线。只有 GPT-6 Astra 完成赛道,第二次尝试用时 5 分 22 秒;Claude Fable 5.1 最好成绩约完成 45%,Grok 4.6 和 GPT-5.6 Sol 每次都只到第一个弯道。