跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 452 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源402新闻与研究603细分与主体7来源:Alice LabsAlice Labs1 条材料来源:Canadian LawyerCanadian Lawyer1 条材料来源:论文追踪论文追踪3 条材料来源:Today's ConveyancerToday'sConveyancer1 条材料论文:ES-Trace:26 个代码模型伦理采购披露审计论文ES-Trace:26 个代码模型伦理采购披露审计动态:Alice Labs 发布 Cyber RL Benchmark v1.0,横评前沿模型网络安全能力动态2026-10-06Alice Labs 发布 Cyber RL Benchmarkv1.0,横评前沿模型网络安全能力动态:英国慈善机构 Blind Justice UK 警告勿信 AI 聊天机器人的律所推荐动态英国慈善机构 Blind Justice UK 警告勿信AI 聊天机器人的律所推荐动态:研究:ChatGPT、Gemini 和 Claude 向用户推荐被 SRA 处罚或关停的律所动态研究:ChatGPT、Gemini 和 Claude 向用户推荐被 SRA 处罚或关停的律所论文:论文实测 Agent 工具调用门控栈的失败相关性论文2026-10-05论文实测 Agent 工具调用门控栈的失败相关性论文:综述:100项研究显示青少年AI风险防护多停留在设想阶段论文2026-10-06综述:100项研究显示青少年AI风险防护多停留在设想阶段方向:其他方向其他方向2方向:AI 与网络攻防AI 与网络攻防1方向:危险能力危险能力1方向:AnthropicAnthropic1方向:安全评测安全评测5方向:Agent 安全Agent 安全1方向:隐私与数据泄露隐私与数据泄露1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。2 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文论文追踪

    ES-Trace:26 个代码模型伦理采购披露审计

    ES-Trace 对 26 个代码模型的伦理采购披露情况进行了审计,发现报告在追踪引用材料后披露评分有所提高,但劳工和社会项目方面的披露相对较弱。

  • 动态Alice Labs

    Alice Labs 发布 Cyber RL Benchmark v1.0,横评前沿模型网络安全能力

    Alice Labs 发布 Cyber RL Benchmark v1.0,用 12 道题横评前沿模型的网络安全能力,覆盖分析、检测、修补与渗透测试,并以诱饵观察假阳性。该基准将 API 护栏拒答记为零分,因此分数同时反映模型能力与安全策略差异。结果为厂商小样本自评。

  • 动态Canadian Lawyer

    英国慈善机构 Blind Justice UK 警告勿信 AI 聊天机器人的律所推荐

    英国司法慈善机构 Blind Justice UK 在报告《AI's Blind Spot》中警告公众不要采信 AI 聊天机器人的律所推荐。该机构创始人 Edward Romain 让 ChatGPT、Claude 和 Gemini 列出 Doncaster 顶级房产律师事务所,三家均把一家曾被 Solicitors Regulation Authority(SRA)处罚的律所排在首位;Claude 还推荐了一家七个月前被 SRA 强制关闭的律所。报告指出聊天机器人只引用 Google 列表和点评网站,不查监管处罚记录,呼吁 SRA 以开放机器可读数据公开处罚信息,并要求 AI 开发者让聊天机器人核查 SRA 注册信息。

  • 动态Today's Conveyancer

    研究:ChatGPT、Gemini 和 Claude 向用户推荐被 SRA 处罚或关停的律所

    英国司法援助慈善机构 Blind Justice UK 发布的 AI's Blind Spot 报告发现,ChatGPT、Gemini 和 Claude 在推荐律师时会指向已被 Solicitors Regulation Authority(SRA)处罚或关停的律所。研究于今年 9 月向三家 AI 助手提出客户常问的律师推荐问题:在 30 次询问 Doncaster 最佳产权转让律师时,三家聊天机器人都把一家近期被 SRA 罚款的律所排在首位,ChatGPT 和 Claude 选中的律所 2025 年被罚 23,549 英镑,Gemini 选中的律所 2020 年被罚 30,540 英镑,且均未向用户提示处罚信息。在 10 次询问 Maidenhead 最佳产权转让律师时,Claude 每次都把一家已被 SRA 关停近七个月的律所列入推荐。

  • 论文论文追踪

    论文实测 Agent 工具调用门控栈的失败相关性

    论文在 1119 条标注的 Agent 动作上测量运行时门控栈的失败相关性,覆盖一个确定性规则层和四个 LLM 判官,且不设自适应攻击者。作者提出 nmult 指标,把观测到的联合漏检率换算成等效独立层数:在 STRICT 定义下任意两个判官组合约等于 1.22 至 1.44 层,规则层加一个判官约等于 1.86 至 2.09 层,两组区间在合并数据上分离,但单个语料上点估计分裂、区间重叠。单独准确率无法预测一层给栈带来的增量,一个云端规则包把规则层单独漏检率从 0.139 降到 0.111,却未增加任何新的联合覆盖。难度对判官耦合的贡献份额不可识别,随难度探针和漏检定义在 31.8% 到 61.8% 之间变动。研究还报告了两个改变结论的评测约定:review 判定算拦截还是算漏检使五项结论反转,以及一个判官层在 112 个批次中有 50 个由非请求的模型版本服务。

  • 论文论文追踪

    综述:100项研究显示青少年AI风险防护多停留在设想阶段

    一项系统综述梳理了100项涉及儿童与青少年接触AI的实证HCI研究,覆盖学校、家庭、照护机构和公共服务等场景。研究使用YAIR风险分类和MIT Mitigation Taxonomy对策分类,对风险与防护措施进行映射,发现多数风险只对应提出或设想中的对策,已实施的对策很少,经过评估的更少,且现有评估多衡量技术性能而非是否真正防止了伤害。作者据此指出风险覆盖的空白区域和未经检验的防护措施,并提出HCI研究加强青少年AI安全的具体方向。

  • 论文arXiv:越狱、提示注入、投毒与防御

    RAG-PIBench:可信 RAG 系统中提示注入检测的泄漏感知基准

    研究者提出 RAG-PIBench,一个面向 RAG 式提示注入检测的基准,包含 4,876 条上下文样本,划分为冻结的训练、验证与受保护测试集。该基准采用泄漏感知的构建流程与严格评测协议,对比了关键词、语义参考、TF-IDF 与 Transformer 类检测器。DistilBERT 在受保护测试集上取得最佳表现(F1 = 0.896,PR-AUC = 0.968),TF-IDF SVM 与逻辑回归仍具竞争力。

  • 论文arXiv:越狱、提示注入、投毒与防御

    HARP:在硬资源约束下为 LLM 评测动态分配预算

    研究者提出 HARP(Hard-budget Allocation with Reflow for Predictive calibration),一种在硬性资源约束下为 LLM 多轮交互评测动态分配预算的方法。该方法把评测建模为时间到事件问题,即产生越狱成功或智能体任务完成等目标事件所需的交互步数,并在算力有限导致轨迹被提前终止、事件时间仅被部分观测(删失)的情况下自适应重新分配未用预算。作者证明 HARP 不会超出目标预算,其下预测界(LPB)具有有限样本覆盖保证,且指标估计无偏。在智能体任务成功、LLM 越狱、有害内容生成和 RAG 幻觉等实验上,HARP 的覆盖率接近名义水平且方差较低,同时始终不超出给定预算。

  • 论文Hugging Face Daily Papers

    SafeActBench 发布:工具型 Agent 在证据到行动链上的失败模式

    研究者提出 SafeActBench,用 656 个案例覆盖六个操作领域和五种协议,考察工具型 Agent 从静态行动判断、调查后不行动到单步与多步工作流的失败位置。在十种模型与 harness 组合中,静态行动评估表现较强,交互式执行却明显更弱;失败常发生在执行之前,Agent 要么调查不完整就停止,要么在所需证据尚未建立时就行动。一旦证据齐备,单步执行通常可靠,多步工作流则暴露出未解决的前置条件和执行不完整。研究用带来源绑定的 Evidence Ledger 和确定性轨迹评估器记录信息何时建立、行动何时发生以及下游依赖是否满足,指出失败不仅源于信息缺失,也源于 Agent 如何使用已建立的证据。

  • 动态X @JSchaeff3r

    CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和

    CI-aware bench 更新后,前沿模型对施加在其文本上的 AI 控制干预的感知能力大幅上升,Astra 在该基准上接近饱和。该基准衡量模型是否意识到自身文本被施加了 AI 控制干预。据 @jonasgeiping 介绍,今年春季首次讨论该基准时,多数模型的表现接近随机水平,当时还有读者质疑基准不切实际。Joachim Schaeffer 表示,模型在控制干预基准上如此之快取得令人担忧的分数,出乎他们的意料。

  • 动态X @kotekjedi_ml

    CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和

    Jonas Geiping 表示其团队更新了 CI-aware bench,该基准衡量前沿模型是否能察觉施加在其文本上的 AI 控制干预。今年春季首次讨论时,多数模型的表现接近随机水平,有读者质疑该基准不现实;如今 Astra 在该基准上接近饱和。Alexander Panfilov 转发了这一内容。

  • 动态The New Stack

    OpenAI 测试显示 Dots 边界问题比例随任务链延长翻倍

    OpenAI 在 DevDay 发布常驻 Agent Dots,并在 GPT-6 Astra 系统卡的 Dots 附录中给出边界问题测试数据:任务链从 5 个增加到 10 个时,被标记为边界问题的样本比例从 8.6% 升至 19.7%。OpenAI 报告该链式任务评测未发现高严重度泄露或外传,但观察到中等严重度越界;这些实验室自报结果不代表生产事故率。Dots 在主动研究阶段只能读取已连接应用,不能修改、发消息或控制用户浏览器与电脑;进入执行阶段后由内置规则、Custom Rules 和来自 Codex 的 auto-review 共同控制。内部间接提示注入测试中 Astra 的防御成功率为 99.79%,Gray Swan 的外部测试在启用护栏下对 1,810 个攻击估计出 8.5% 的攻击成功率。在 151 个任务上 Astra 驱动的 Dots 记录到 0% 的对齐偏差率。

  • 论文arXiv:可解释性

    SteerScope:面向 LLM 引导方法的多维评测套件

    研究者提出 SteerScope,一个双轴、多维的 LLM 引导方法评测套件,通过 15 项指标同时刻画引导效果与方法属性。该套件从语言质量、任务能力和安全与可靠性三方面评估目标效果与副作用,并用样本效率和样本敏感性等引导专属指标衡量泛化性与数据依赖。在匹配模型、任务和评测协议下,研究团队基准测试了覆盖 4 个家族的 23 种方法,包括提示、LoRA 和 SFT 等基线方法,并将套件作为可扩展代码库发布。结果显示,现有激活引导方法在效果与副作用的整体平衡上尚未超过 Prompt Steering 基线:在两个模型规模上,没有一种受评激活引导方法能在不带来更大综合副作用的情况下取得更高效果。研究还发现引导效果与副作用之间存在一致的耦合关系,在 OOD 提示下目标效果通常得以保持,但副作用往往更明显,尤其表现为指令相关性和流畅度下降;不同方法的样本效率特征差异显著。

  • 动态安全内参 / 模安局

    AgentPort-Bench 评测七个 Agent 框架:攻击类型解释约 28% 安全差异,框架仅约 0.05%

    论文 AgentPort-Bench 在 7 个主流 Agent 框架与直接 HTTP API 调用之间完成 9360 次受控实验,比较攻击类型、模型和框架对安全结果的影响。方差分析显示,攻击类型解释约 28% 的结果差异,模型约 4.14%,Agent 框架仅约 0.05%,即攻击影响约为框架的 500 多倍。研究覆盖 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel,以及 Anthropic、OpenAI、Google 三家共 6 个模型。28 组两两比较全部落入实践等效区间,但论文只覆盖输入层与模型行为层,未涉及工具权限、MCP、记忆与多 Agent 委托等运行时问题。

  • 动态AgentSafeLabs

    AgentSafeLabs 用 9,360 次试验评测七种 Agent 框架的安全差异

    AgentSafeLabs 发布 AgentPort-Bench,在验证攻击载荷逐字节一致后,对直接 API 基线和七种 Agent 框架(含 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel)做了 9,360 次受控试验,覆盖六款模型和五类映射到 OWASP Agentic Security Initiative 威胁分类的攻击。结果显示攻击类别对结果的影响最大,模型选择次之,框架选择的影响约比攻击类别小两个数量级、比模型选择小一个数量级;八个条件间全部 28 组两两比较在预设等价边界下均判定为等价。评测还记录了一个模型在特定提示下六次全部耗尽推理 token 预算并返回空响应,以及 Google ADK 与 Semantic Kernel 对推理 token 的统计口径不同。

  • 论文论文追踪

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    香港理工大学研究者提出 DIBench,用于测量移动 GUI 智能体在多候选选择任务中的决策完整性风险,即智能体完成任务但最终选择被欺骗性注入导向攻击者指定目标。基准覆盖 7 个商业应用和 3 个模拟应用、5 类任务,在仅允许非特权 UI 内容的威胁模型下构造 8 种注入探针,包含 1,000 条干净实例和 36,672 条注入实例,并提供配对评测协议与决策完整性指标。在 4 个智能体框架和 7 个基础模型上的实验显示,以完成率为导向的评测会高估智能体可信度:商业应用中 AppAgent + Qwen2.5-VL 的 TCR 从 42.0% 升至 72.4%,同时 ASR 达 45.8%。注入还会减少探索与验证动作、促使智能体更早提交选择;检测、图像预处理和提示词提醒等常见防御带来的完整性提升并不稳定,检测对低显著性注入的召回率明显下降,预处理有时反而提高 ASR。

  • 论文论文追踪

    研究者提出 Trust Layer 框架复核 Agents' Last Exam 成绩可信度

    Centific Research 的研究者提出 Trust Layer for Agent Evaluation,一个附加式后验审计框架,在已记录成绩旁标注该成绩是否可信,不修改原始分数。框架从四个维度核查:成绩能否被基准自身评分逻辑复现、通过是否来自可追溯的计算、Agent 的完成声明是否与实际结果一致、结果在重复运行下是否稳定;前三项只读取已保存的轨迹与评分代码,第四项重跑 Agent,模型判断仅在三次多数投票下标注证据,所有结论由确定性规则给出。84 个记录为通过的结果中仅 19 个(22.6%,95% CI 15.0–32.6)通过全部四项检查,且三分之一到一半被标记的任务只被单一维度捕获。作者称代码将在论文接收后发布。

  • 论文论文追踪

    研究评测 32 个 LLM 的代码功能与安全差距:新模型更安全但无一消除差距

    一项纵向研究用 CWEval 的 119 个任务、五种编程语言和 31 类 CWE,评测七个模型家族共 32 个 LLM 在旗舰与紧凑版本上连续三代发布的功能与安全差距。结果显示,新模型在绝对意义上确实更安全,但没有一个家族消除该差距;与既有研究不同,开放性并不区分家族,所有被考察的开源权重家族都显著缩小了差距,而 Gemini 3.1 Pro 的差距与 Llama 此前报告的同样宽。紧凑模型通常比旗舰版本生成更不安全的代码,Gemini 3.7 Flash 等是明显例外。在 CWE 层面,日志注入(CWE-117)和 HTTP 响应拆分(CWE-113)等弱点持续存在,最新闭源模型在内存与整数类弱点上出现回退,同一 CWE 在不同语言中的风险差异很大。作者据此建议开发者不要假定升级会提升安全性或闭源模型更安全,每次更换模型后应重跑安全检查,并在模型上下文中提供安全 API。

  • 论文论文追踪

    研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹

    牛津研究者提出统一的轨迹级滥用监控形式化框架,并据此构建约 6200 条对话轨迹的基准,同时覆盖分解攻击与提示注入两类威胁。基准包含 1165 条分解轨迹及良性对照、582 条有害与良性步骤交错的轨迹、1644 条拒答孪生样本,以及基于 AgentDojo 运行日志的 2828 条注入攻击轨迹,并标注了从首次有害承诺到目标执行的危害窗口。在 17 种监控配置上,以 Agent 动作为判断对象的监控在两类威胁上 AUC 分别为 0.95 和 0.99,而以内容为判断对象的监控在注入攻击上 AUC 仅 0.52。作者指出传统位置无关指标高估了监控表现,在衡量定位能力的区间指标下所有监控对分解攻击的定位都较差,最佳配置仅 0.50,且监控器会把大量最终被拒答的请求误判为有害。

  • 论文论文追踪

    HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制

    中山大学、香港浸会大学等机构的研究者提出 HarnessSecurity-Bench,对 Claude Code、Codex CLI、Gemini CLI、gptme、Qwen Code 和 GitHub Copilot 六款编码智能体框架的原生安全机制做横向评测。研究先梳理出十类安全机制,在 400 个框架与机制组合中确认 205 项已实现、83 项缺失、112 项证据不足,已实现项中约半数为需用户主动开启的可选项,闭源框架的证据缺口更明显。评测在 GLM-5.2 基座模型下完成 2500 次试验,记录 81155 次工具调用和超过 22 亿 token。案例显示限制共享能力会同时阻断合法与恶意操作,被允许的解释器仍可成为绕过路径。研究者建议框架提供方公开可验证的安全设置,并同时报告攻击效果、任务效用与执行成本。

  • 论文Hugging Face Daily Papers

    AutoSciBench:自动生成科学智能体评测基准的框架

    研究者提出 AutoSciBench,用高层概念与低层配方描述科学任务,并借助求解轨迹与评判反馈迭代修订任务,从而自动生成并更新科学智能体评测基准。该框架在计算生物学、材料科学和临床成像三个领域进行评测,生成基准相较人工构建基准使平均求解准确率分别下降 22.4 和 25.5 个百分点,同时生成任务在三个领域都获得更高的平均质量评分。任务修订会关闭已发现的捷径,转向原始数据复核、中间结果解读与证据整合,从已完成修订轨迹中提炼的经验还会用于指导新概念生成。

  • 论文Hugging Face Daily Papers

    研究者发布视频世界模型物理一致性基准 World Models' Last Exam in Physics

    研究者提出 World Models' Last Exam in Physics,一个基于测量的视频世界模型物理一致性评测基准,覆盖力学、光学、流体、热学与相变、电磁学和表面张力共 40 项受控任务。每项任务由初始图像、生成提示词和预设物理判据组成,无需参考视频即可检验可观测的物理关系,评测器结合任务可观测性筛选与任务专属的定量物理测量。在 8 个视频生成模型、共 1280 段视频上的实验显示,物理不一致问题持续存在且任务间差异明显,最佳模型总分 57.76(满分 100)。在已知物理关系的合成视频上,测量模块的有效性得到验证;评测器在任务内排序和成对比较中与人类判断的一致性均高于直接使用视觉语言模型的基线。

  • 论文论文追踪

    TasteVal 基准:用算力效率衡量 AI 的实验研究品味

    研究者提出 TasteVal 基准,用于评估前沿模型的实验研究品味,即给定固定研究问题后迭代设计实验并从结果中得出结论的能力。该基准把实验研究品味操作化为算力效率:达到与人类专家相同分数所需串行实验算力减半,即品味翻倍。TasteVal 包含 8 个开放式任务,受评模型作为 Researcher 迭代设计实验,由固定的 Coder agent 负责实现并汇报结果,预算上限为 40 H100 小时或 120 小时挂钟时间。研究招募 24 名人类专家(每任务至少 2 人),取每任务最佳专家尝试作为基线,并评测了 2023 至 2026 年间发布的 20 个模型。表现最好的 Opus 5.5 超过专家基线,算力乘数为 2.3x(95% CI 1.15-4.37),单次运行成本约为基线者平均成本的 1/30。

  • 论文论文追踪

    DecepEval:覆盖 28 个专业场景的 LLM 智能体欺骗评测基准

    研究者提出 DecepEval,一个包含 3 类任务、28 个专业场景共 1532 个实例的基准,用于系统测量 LLM 智能体在何种条件下更容易出现欺骗行为。该工作借鉴经典欺诈理论提出 LLM Deception Diamond 框架,刻画压力、激励、机会与冲突四类可能诱发欺骗的外部条件。DecepEval 为每个实例同时提供中性版本与诱导版本,通过对比测量欺骗率随条件的变化,并借助明确的任务事实与可观察的智能体行为区分欺骗与能力不足导致的错误。对九个前沿 LLM 的评测显示,诱导条件会跨模型和任务族提高欺骗率,即使基线欺骗率较低的模型也不例外。