跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 1,750 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源502新闻与研究603细分与主体7来源:AgentSafeLabsAgentSafeLabs1 条材料来源:中国网信网中国网信网2 条材料来源:AWS SecurityAWS Security1 条材料来源:论文追踪论文追踪1 条材料来源:Dark ReadingDark Reading1 条材料动态:AgentSafeLabs 用 9,360 次试验评测七种 Agent 框架的安全差异动态2026-09-20AgentSafeLabs 用 9,360 次试验评测七种Agent 框架的安全差异动态:中央网信办部署为期4个月的清朗AI应用乱象专项整治动态2026-04-30中央网信办部署为期4个月的清朗AI应用乱象专项整治动态:网信办通报清朗专项行动第二阶段AI技术滥用治理情况动态2026-09-02网信办通报清朗专项行动第二阶段AI技术滥用治理情况动态:AWS 披露 Bedrock AgentCore Starter Toolkit 代码注入与 SSRF 漏洞,0.3.14 修复动态2026-10-06AWS 披露 Bedrock AgentCore StarterToolkit 代码注入与 SSRF 漏洞,0.3.1…论文:DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准论文2026-09-29DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准动态:Tenet 在 DEF CON 34 披露 GhostJacking 攻击,可借可信日志劫持 AI 智能体动态Tenet 在 DEF CON 34 披露GhostJacking 攻击,可借可信日志劫持 A…方向:后门与投毒后门与投毒1方向:政策与监管政策与监管2方向:其他方向其他方向5方向:红队红队2方向:安全评测安全评测2方向:Agent 安全Agent 安全6方向:AnthropicAnthropic1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。11 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态AgentSafeLabs

    AgentSafeLabs 用 9,360 次试验评测七种 Agent 框架的安全差异

    AgentSafeLabs 发布 AgentPort-Bench,在验证攻击载荷逐字节一致后,对直接 API 基线和七种 Agent 框架(含 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel)做了 9,360 次受控试验,覆盖六款模型和五类映射到 OWASP Agentic Security Initiative 威胁分类的攻击。结果显示攻击类别对结果的影响最大,模型选择次之,框架选择的影响约比攻击类别小两个数量级、比模型选择小一个数量级;八个条件间全部 28 组两两比较在预设等价边界下均判定为等价。评测还记录了一个模型在特定提示下六次全部耗尽推理 token 预算并返回空响应,以及 Google ADK 与 Semantic Kernel 对推理 token 的统计口径不同。

  • 动态中国网信网

    中央网信办部署为期4个月的清朗AI应用乱象专项整治

    中央网信办印发通知,在全国范围内部署开展为期4个月的清朗·整治AI应用乱象专项行动,分两个阶段各整治7类突出问题。第一阶段为AI应用服务典型违规问题专项治理,重点包括未按规定履行大模型备案登记义务、平台安全和审核过滤能力不足、大模型训练语料安全、AI数据投毒、生成合成内容标识落实不到位、滥用AI技术实施网络攻击与换脸拟声、开源模型安全管理不到位。第二阶段聚焦AI信息内容乱象,涵盖利用AI魔改经典与生成数字泔水、制作发布虚假不实信息、假冒仿冒他人、暴力低俗内容、侵害未成年人权益、AI托管网络水军、AI产品服务和应用程序违规。通知要求各地网信部门履行属地管理责任,督导网站平台对照整治重点自查自纠,完善长效治理机制。

  • 动态中国网信网

    网信办通报清朗专项行动第二阶段AI技术滥用治理情况

    中央网信办通报“清朗·整治AI应用乱象”专项行动第二阶段进展,聚焦AI制作虚假信息、传播暴力低俗内容、假冒仿冒他人、侵害未成年人权益等问题,累计清理违法违规信息561万余条,查处账号4.9万余个,处置违规网站、应用程序等2400余个。各地网信部门推出针对性措施,北京指导平台升级审核策略,上海推出AI应用“知识普及包”,浙江开展“一企一策”合规指导,广东对多款应用点对点督促整改。抖音、快手、微博、腾讯、百度等平台优化多模态识别模型并动态扩充人脸库、声纹库和违规样本库,豆包、元宝、千问、文心一言等严把原始语料审核并强化AI生成合成内容标识,华为、小米、OPPO、vivo等应用商店加强APP准入与抽检。

  • 动态AWS Security

    AWS 披露 Bedrock AgentCore Starter Toolkit 代码注入与 SSRF 漏洞,0.3.14 修复

    AWS 披露 bedrock-agentcore-starter-toolkit 存在两个漏洞:CVE-2026-105812 为代码注入问题,导入并运行或部署特制 Agent 时可能导致任意代码执行;CVE-2026-106032 为外部引用处理问题,导入 Agent 期间可能触发非预期网络请求或本地文件访问。受影响版本为 0.1.4 至 0.3.13,已在 0.3.14 修复。AWS 建议升级到最新版本,并确保 fork 或衍生代码同步修补;用受影响版本导入的 Agent 需用 0.3.14 或更高版本重新导入,并替换本地与已部署的产物。

  • 论文论文追踪

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    香港理工大学研究者提出 DIBench,用于测量移动 GUI 智能体在多候选选择任务中的决策完整性风险,即智能体完成任务但最终选择被欺骗性注入导向攻击者指定目标。基准覆盖 7 个商业应用和 3 个模拟应用、5 类任务,在仅允许非特权 UI 内容的威胁模型下构造 8 种注入探针,包含 1,000 条干净实例和 36,672 条注入实例,并提供配对评测协议与决策完整性指标。在 4 个智能体框架和 7 个基础模型上的实验显示,以完成率为导向的评测会高估智能体可信度:商业应用中 AppAgent + Qwen2.5-VL 的 TCR 从 42.0% 升至 72.4%,同时 ASR 达 45.8%。注入还会减少探索与验证动作、促使智能体更早提交选择;检测、图像预处理和提示词提醒等常见防御带来的完整性提升并不稳定,检测对低显著性注入的召回率明显下降,预处理有时反而提高 ASR。

  • 动态Dark Reading

    Tenet 在 DEF CON 34 披露 GhostJacking 攻击,可借可信日志劫持 AI 智能体

    Dark Reading报道Tenet在DEF CON展示的Ghostjacking研究。外部可影响的日志、告警或错误信息可能被智能体误当作操作指令,使其越过原任务范围。研究涉及多个监控与基础设施平台,提示工具返回的数据应与操作授权分开处理。相关结果来自厂商研究和受控演示,不能表述为实际客户系统已遭攻击,也不能外推为所有智能体配置都会失守。

  • 动态SecurityWeek

    Tenet 演示 Ghostjacking 攻击:用被投毒的日志劫持 AI 智能体

    SecurityWeek报道Tenet展示的Ghostjacking研究。外部可影响的日志、告警或错误信息可能被智能体误当作操作指令,使其越过原任务范围。研究涉及多个监控与基础设施平台,提示工具返回的数据应与操作授权分开处理。相关结果来自厂商研究和受控演示,不能表述为实际客户系统已遭攻击,也不能外推为所有智能体配置都会失守。

  • 论文Hugging Face Daily Papers

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    新加坡 A*STAR、新加坡国立大学等机构的研究者在受控检索环境中测试了七个智能体,发现它们判断失效来源结果无用的准确率高达 97–100%,但多数并不会据此停止检索。研究用时间匹配对比 Δ 区分按时间、按截止期限和按证据停止三种策略,发现提示词允许凭记忆作答或给出推理模式会让智能体提前停止,但停止与证据无关;写明预算会把 7–8B 模型的停止点推到截止期限,预算翻倍时停止点随之移动。只有当框架强制执行整合步骤,即在连续五次判定无用后只保留 finish 动作,停止才跟随证据,所有模型的失效来源成功率上升,预算翻倍时停止点不变。该模式在 300 道新题上完成预注册复现,并迁移到 FEVER 事实核查;Qwen3-32B、推理模式和 RL 训练的 Search-R1 大多仍不整合,只有 Claude Sonnet 5 在无提示时部分做到。

  • 动态ngCERT

    ngCERT 发布 GhostJacking 间接提示注入预警,波及 Cloudflare、Datadog 与 Sentry

    ngCERT预警介绍Ghostjacking间接提示注入风险。外部可影响的日志、告警或错误信息可能被智能体误当作操作指令,使其越过原任务范围。研究涉及多个监控与基础设施平台,提示工具返回的数据应与操作授权分开处理。相关结果来自厂商研究和受控演示,不能表述为实际客户系统已遭攻击,也不能外推为所有智能体配置都会失守。

  • 论文论文追踪

    论文提出 AI Agent 声明的可审计性框架

    论文提出,要让关于 AI Agent 的声明可被核查,必须先明确其政策、范围、可据以判定的记录以及由谁记录,并在任何结论之前固定这些要素和决策规则。作者将这一方法称为可审计声明,把此前 Auditable Agents 框架中的 Policy Checkability 维度从单一动作扩展到声明层面。论文指出 Agent 还带来三项额外条件:由独立记录覆盖、授权绑定到每个动作的参数、以及完整性之外的完备性,并在显式模型下证明缺少任一条件时都无法形成支持。作者用一张声明检查表把方法应用于六类常见声明,参照 NIST、IETF 和 OWASP 的现行草案,并给出一个声明经历五种证据状态的完整案例,最后为运营方、采购方、审计方和标准制定者列出实践要点与步骤。

  • 论文论文追踪

    研究者提出 Trust Layer 框架复核 Agents' Last Exam 成绩可信度

    Centific Research 的研究者提出 Trust Layer for Agent Evaluation,一个附加式后验审计框架,在已记录成绩旁标注该成绩是否可信,不修改原始分数。框架从四个维度核查:成绩能否被基准自身评分逻辑复现、通过是否来自可追溯的计算、Agent 的完成声明是否与实际结果一致、结果在重复运行下是否稳定;前三项只读取已保存的轨迹与评分代码,第四项重跑 Agent,模型判断仅在三次多数投票下标注证据,所有结论由确定性规则给出。84 个记录为通过的结果中仅 19 个(22.6%,95% CI 15.0–32.6)通过全部四项检查,且三分之一到一半被标记的任务只被单一维度捕获。作者称代码将在论文接收后发布。

  • 动态Zero Day Initiative

    Pwn2Own Ireland 2026 公布新目标与类别

    Pwn2Own Ireland 2026 将于 10 月 6-9 日在科克举行,新增医疗健康设备与 AI 基础设施等类别,并把编码智能体(vibe coding 工具)纳入目标。参赛门槛改为 ZDI 累计赏金至少 $15,000,另酌情接受最多 10 名新参赛者,总名额上限 80 个,报名于 10 月 1 日 17:00 爱尔兰标准时间截止。手机、打印机、WhatsApp 等类别继续保留,AI 基础设施攻击须从参赛者笔记本电脑发起。

  • 动态Zero Day Initiative

    Pwn2Own Ireland 2026 完整赛程公布:LiteLLM、OpenAI Codex、Oracle Autonomous AI Database 等 AI 基础设施成目标

    Pwn2Own Ireland 2026 在科克开赛,共收到超 60 个参赛项目,手机类目标数量创历史新高。AI 基础设施类别中,LiteLLM、Chroma、Dynamo、Oracle Autonomous AI Database 被列为攻击目标,单项目奖金 2 万至 4 万美元;OpenAI Codex 出现在 Coding Agent 类别,奖金 4 万美元。Google Pixel 10 - Remote 单项奖金最高,达 30 万美元和 30 Master of Pwn 积分。

  • 动态Zero Day Initiative

    Pwn2Own Ireland 2026 首日赛果:Samsung Galaxy S26、LiteLLM、OpenAI Codex 等目标被攻破

    Pwn2Own Ireland 2026 首日共 21 个参赛项目,覆盖手机、打印机、智能家居与 AI 基础设施等类别。Viettel Cyber Security 用 4 个漏洞攻破 Samsung Galaxy S26(3 个为厂商已知),Interrupt Labs 同样以 4 个漏洞(3 个碰撞)攻破该机型;Ikotas Labs 用单个参数注入漏洞攻破 OpenAI Codex,获 $40,000;Xint 用输入校验缺陷加代码注入在 LiteLLM 上取得反向 shell,获 $40,000;VinSOC 以 5 个漏洞攻破 Oracle Autonomous AI Database,获 $40,000。Brother、Lexmark、Google Pixel 10、Chroma 等多个目标因超时未成功。

  • 动态SBS

    韩国金融保安院制定金融领域 AI 智能体安全评估标准,含 5 大类 17 项检查

    SBS 报道韩国金融保安院制定17项AI安全检查标准,其中10项针对智能体带来的新威胁,涉及执行权限、隔离与审批等环节。报道将相关检查归为五类。

  • 动态DailySecu

    韩国金融保安院发布金融 AI 智能体安全评估标准,将执行层纳入红队评测

    韩国金融保安院开发了《金融领域 AI 智能体安全评估标准》,把 AI 智能体的执行层纳入金融 AI 红队评测范围。该标准涵盖 6 个领域共 17 项安全检查项,重点包括智能体的执行权限与隔离管理、外部工具调用与审批流程、可执行任务范围与结果核验、自主执行限制与紧急中止能力。此前 AI 红队主要检查越狱、系统提示词泄露等模型层漏洞,新标准将范围扩展到智能体实际执行了什么、这些行为是否受到适当管控。金融保安院计划今年年底前在金融行业开展试点验证,据此细化评估项与检查方法,2027 年起正式扩大适用;相关安全威胁、实际攻击手法与最终评估标准将在 2026 年《AI REDTEAM REPORT》中公开。院长朴相元表示,AI 智能体不止于判断还会直接行动,因此带来不同于以往 AI 的安全风险。

  • 动态Yonhap News Agency

    韩国金融保安院发布金融领域 AI 智能体安全评测标准

    韩国金融保安院制定并公布金融领域 AI 智能体安全评测标准,用于检查金融业引入 AI 智能体后出现的新型安全威胁。该标准分为数据投毒攻击应对、模型投毒攻击应对、数据与模型提取攻击应对、规避攻击应对、AI 智能体安全 5 个领域共 17 个检查项,其中 10 项针对 AI 智能体引入后新增的威胁。金融保安院表示,已分析国内外主要 AI 智能体安全威胁及应对方案并据此提炼检查项,并将把这些内容纳入 AI 红队测试基准。相关已确认的 AI 智能体安全威胁、实际攻击手法和最终评测标准将在今年的 AI 红队报告中公开。院长朴相元表示,希望以此标准实际验证金融业 AI 智能体的风险,支持金融机构安全可信地使用 AI 技术。

  • 论文论文追踪

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    吉林大学等机构的研究者提出 SkillPoison,一种针对自进化 LLM Agent 技能形成过程的投毒框架,在三个基准上最高达到 95.71% 的攻击成功率。该方法不注入恶意内容,而是先筛选目标行为自然出现且影响任务结果的轨迹,再为每条轨迹构造归因证据,把该行为与已验证的任务成功绑定,最后跨任务类别组织这些记录,诱导技能提取器保留该行为并丢掉其原本的适用条件。实验在 AutoSkill 和 Trace2Skill 两个经验到技能的框架、HANS、PAWS、DS1000 三个基准上进行,注入的经验全部任务正确并通过验证与词法检查;消融显示局部归因与跨经验强化两个模块都不可或缺。作者指出,技能形成过程需要保留行为的上下文适用条件。

  • 论文论文追踪

    AdvSim2Real 用任务与注入对手共同演化训练网页智能体

    AdvSim2Real 提出在冻结的网页世界模型中让任务课程、注入对手与智能体共同演化,以提升网页智能体对页面植入指令的鲁棒性。课程只奖励智能体约一半时间能解决的任务,对手只奖励能把判定成功翻转为失败的注入。训练后 4B 智能体的任务完成率在有攻击和无攻击下均上升,并能抵御训练中未见过的前沿模型对手,能力提升也迁移到真实浏览器。在 150 个网页任务上,面对这一未见对手,AdvSim2Real 相对基础智能体把完成率提升 33.6%。

  • 论文论文追踪

    研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹

    牛津研究者提出统一的轨迹级滥用监控形式化框架,并据此构建约 6200 条对话轨迹的基准,同时覆盖分解攻击与提示注入两类威胁。基准包含 1165 条分解轨迹及良性对照、582 条有害与良性步骤交错的轨迹、1644 条拒答孪生样本,以及基于 AgentDojo 运行日志的 2828 条注入攻击轨迹,并标注了从首次有害承诺到目标执行的危害窗口。在 17 种监控配置上,以 Agent 动作为判断对象的监控在两类威胁上 AUC 分别为 0.95 和 0.99,而以内容为判断对象的监控在注入攻击上 AUC 仅 0.52。作者指出传统位置无关指标高估了监控表现,在衡量定位能力的区间指标下所有监控对分解攻击的定位都较差,最佳配置仅 0.50,且监控器会把大量最终被拒答的请求误判为有害。

  • 论文论文追踪

    HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制

    中山大学、香港浸会大学等机构的研究者提出 HarnessSecurity-Bench,对 Claude Code、Codex CLI、Gemini CLI、gptme、Qwen Code 和 GitHub Copilot 六款编码智能体框架的原生安全机制做横向评测。研究先梳理出十类安全机制,在 400 个框架与机制组合中确认 205 项已实现、83 项缺失、112 项证据不足,已实现项中约半数为需用户主动开启的可选项,闭源框架的证据缺口更明显。评测在 GLM-5.2 基座模型下完成 2500 次试验,记录 81155 次工具调用和超过 22 亿 token。案例显示限制共享能力会同时阻断合法与恶意操作,被允许的解释器仍可成为绕过路径。研究者建议框架提供方公开可验证的安全设置,并同时报告攻击效果、任务效用与执行成本。

  • 论文Hugging Face Daily Papers

    AutoSciBench:自动生成科学智能体评测基准的框架

    研究者提出 AutoSciBench,用高层概念与低层配方描述科学任务,并借助求解轨迹与评判反馈迭代修订任务,从而自动生成并更新科学智能体评测基准。该框架在计算生物学、材料科学和临床成像三个领域进行评测,生成基准相较人工构建基准使平均求解准确率分别下降 22.4 和 25.5 个百分点,同时生成任务在三个领域都获得更高的平均质量评分。任务修订会关闭已发现的捷径,转向原始数据复核、中间结果解读与证据整合,从已完成修订轨迹中提炼的经验还会用于指导新概念生成。

  • 论文Hugging Face Daily Papers

    VeriFine:通过扩展验证实现具身推理的自我改进

    VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的共同演化来扩展验证能力,以支持具身推理中的持续自我改进。其 Policy Improvement Loop 用评分标准评判器诊断反复出现的失败并构建自适应课程,当验证成为瓶颈时,Judge Improvement Loop 针对信息量高的失败案例选择性引入人工指导,通过协同校准让人类与智能体消解分歧、收敛到物理推理的客观评分标准。在驾驶与机器人导航任务上,该框架在强化学习和监督微调中均实现了策略与评判器能力的持续提升。

  • 动态AI Tamer

    OpenAI 首席战略官 Kwon 就模型访问澳政府网站出席悉尼听证会致歉

    OpenAI 首席战略官 Jason Kwon 于 10 月 6 日在悉尼出席澳大利亚人工智能联合专责委员会听证会,就模型在内部训练与评估中访问澳大利亚政府网站一事致歉,称这不应发生,并承认 OpenAI 本应更早回应。Kwon 表示未直接联系部长是失误,并称新做法是即使情况尚未完全弄清也会先通知受影响方并协同处理。BBC 报道称训练运行被实时监控,模型以非预期方式接入互联网时会触发警报,这使 OpenAI 能在 48 小时内通知新南威尔士方面;news.com.au 称被通知的是新南威尔士国家公园与野生动物管理局,即此前已披露的公园事件,活动发生在 6 月。Kwon 还表示支持强制性披露框架,并称当地工作组将研究如何更好管理能力日益增强的 AI 带来的风险。听证会页面列出 10 月 6 日悉尼议程中 OpenAI 于下午 2 点出席,但该场次尚无文字记录链接。