全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态安全内参 / 模安局
AgentPort-Bench 评测七个 Agent 框架:攻击类型解释约 28% 安全差异,框架仅约 0.05%
论文 AgentPort-Bench 在 7 个主流 Agent 框架与直接 HTTP API 调用之间完成 9360 次受控实验,比较攻击类型、模型和框架对安全结果的影响。方差分析显示,攻击类型解释约 28% 的结果差异,模型约 4.14%,Agent 框架仅约 0.05%,即攻击影响约为框架的 500 多倍。研究覆盖 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel,以及 Anthropic、OpenAI、Google 三家共 6 个模型。28 组两两比较全部落入实践等效区间,但论文只覆盖输入层与模型行为层,未涉及工具权限、MCP、记忆与多 Agent 委托等运行时问题。
- 动态AgentSafeLabs
AgentSafeLabs 用 9,360 次试验评测七种 Agent 框架的安全差异
AgentSafeLabs 发布 AgentPort-Bench,在验证攻击载荷逐字节一致后,对直接 API 基线和七种 Agent 框架(含 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel)做了 9,360 次受控试验,覆盖六款模型和五类映射到 OWASP Agentic Security Initiative 威胁分类的攻击。结果显示攻击类别对结果的影响最大,模型选择次之,框架选择的影响约比攻击类别小两个数量级、比模型选择小一个数量级;八个条件间全部 28 组两两比较在预设等价边界下均判定为等价。评测还记录了一个模型在特定提示下六次全部耗尽推理 token 预算并返回空响应,以及 Google ADK 与 Semantic Kernel 对推理 token 的统计口径不同。
- 论文论文追踪
研究评测 32 个 LLM 的代码功能与安全差距:新模型更安全但无一消除差距
一项纵向研究用 CWEval 的 119 个任务、五种编程语言和 31 类 CWE,评测七个模型家族共 32 个 LLM 在旗舰与紧凑版本上连续三代发布的功能与安全差距。结果显示,新模型在绝对意义上确实更安全,但没有一个家族消除该差距;与既有研究不同,开放性并不区分家族,所有被考察的开源权重家族都显著缩小了差距,而 Gemini 3.1 Pro 的差距与 Llama 此前报告的同样宽。紧凑模型通常比旗舰版本生成更不安全的代码,Gemini 3.7 Flash 等是明显例外。在 CWE 层面,日志注入(CWE-117)和 HTTP 响应拆分(CWE-113)等弱点持续存在,最新闭源模型在内存与整数类弱点上出现回退,同一 CWE 在不同语言中的风险差异很大。作者据此建议开发者不要假定升级会提升安全性或闭源模型更安全,每次更换模型后应重跑安全检查,并在模型上下文中提供安全 API。
- 论文论文追踪
HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制
中山大学、香港浸会大学等机构的研究者提出 HarnessSecurity-Bench,对 Claude Code、Codex CLI、Gemini CLI、gptme、Qwen Code 和 GitHub Copilot 六款编码智能体框架的原生安全机制做横向评测。研究先梳理出十类安全机制,在 400 个框架与机制组合中确认 205 项已实现、83 项缺失、112 项证据不足,已实现项中约半数为需用户主动开启的可选项,闭源框架的证据缺口更明显。评测在 GLM-5.2 基座模型下完成 2500 次试验,记录 81155 次工具调用和超过 22 亿 token。案例显示限制共享能力会同时阻断合法与恶意操作,被允许的解释器仍可成为绕过路径。研究者建议框架提供方公开可验证的安全设置,并同时报告攻击效果、任务效用与执行成本。
- 动态AgentPrivArena project
AgentPrivArena 发布 Agent 隐私评测基准与运行时审计框架
AgentPrivArena 用真实 MCP 工具和本地服务评测智能体隐私,区分敏感信息进入上下文与最终对外泄露。作者实验中,情境完整性审计将平均输出泄露率从46.8%降至17.8%,但敏感信息进入上下文的比例仍约74%至78%;因此减少输出泄露不等于避免不必要读取。结果来自特定模型和任务设置,未经独立复现,信息流提取不完整也是机制限制。
- 动态Brennan Center for Justice
Brennan Center 复测:六款聊天机器人多数仍不读取 AI 图像来源元数据
Brennan Center 在加州 AI 透明度法生效后复测六款聊天机器人识别 AI 生成图像的能力,结果显示表现没有改善。测试覆盖 ChatGPT、Claude、Gemini、Grok、Meta AI 和 Perplexity,用 Gemini 与 ChatGPT 生成的图像进行验证,只有 Gemini 读取了图像内嵌的来源元数据并指出创建工具,其余聊天机器人均未评估元数据,仅依赖视觉判断。对 Gemini 生成的邮政工人分拣选举邮件图像,四款聊天机器人误判为真实照片,其中 ChatGPT 和 Perplexity 注意到右下角可见水印却将其解释为社交媒体或平台标记。研究者指出,法律要求企业提供免费工具供用户核查图像是否由 AI 生成,但未要求该工具嵌入聊天机器人内部,建议将核查能力直接集成到聊天机器人中。
- 动态VentureBeat
VentureBeat 调查:40% 企业以 OpenAI 护栏为 Agent 主要安全层,59% 遭遇过 Agent 安全事件
VentureBeat Intelligence 在 8 月调查了 137 家百人以上企业如何保护 AI Agent,40% 指定了主要安全层的企业选择 OpenAI 内置护栏与审核工具,较 7 月的 21% 接近翻倍,Microsoft Azure 为 22%、Google Cloud 17%、Anthropic 13%、AWS 8%,五家模型与云厂商合计占 99%。在运行 Agent 的企业中,59% 过去 12 个月发生过 Agent 导致的安全事件或险情,30% 为已确认事件。62% 已投产 Agent 的企业让部分或全部 Agent 共用 API key 或人类账号凭证,仅 38% 为每个 Agent 分配独立受管身份;仅 9% 的受访者称隔离高风险 Agent 最符合其安全方案,无人把运行时沙箱工具列入所用平台。
- 动态Severity Daily
解读 GTIG AI 漏洞趋势报告:公开署名样本中 RCE 占比 50%
Google Threat Intelligence Group 于 2026 年 9 月 30 日发布《Vulnerability Discovery and Exploitation Trends in the AI Era》,报告称 AI 发现的漏洞中恰好 50% 导致远程代码执行(RCE),而整个 CVE 生态中这一比例为 26%。报告统计窗口为 2025 年 1 月至 2026 年 8 月,累计追踪 2,076 个 AI 相关 CVE,其中 1,500 多个来自 2026 年 1 月至 8 月;披露量从 2026 年 1 月的 5,045 个增至 7 月的 10,477 个,8 月峰值 10,740 个。GTIG 自述其统计依赖厂商公开署名,并承认因缺乏标准化元数据、厂商直接在生产环境静默修补而不申请 CVE,公开数据显著低估 AI 发现的漏洞数量,但未说明低估偏向哪个方向。
- 论文论文追踪
AgentAudit:面向 AI Agent 全生命周期信任评估的开源框架
研究者提出 AgentAudit,一个可附加在任意 LLM Agent 上、只读取执行轨迹而不干预其运行的开源评估框架,覆盖规划、工具选择、工具执行、记忆与推理的完整流程。该框架从指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实性、安全与执行完整性十个能力、接地、安全与行为维度评估整条执行轨迹,并结合行为分类与失败归因定位出错的阶段。所有轨迹由同一个固定裁判模型打分,而该模型本身也是被评测模型之一,作者在第七节 E 小节讨论了这一局限。论文还指出,任务完成表现相近的模型在可信度上可能差异很大,若干非前沿模型在对抗任务中反复被归类为 Unsafe_Compliance,而不只是任务失败,这是通过/失败式基准无法呈现的区别。
- 论文论文追踪
论文提出诊断长程安全 LLM Agent 失败来源的检查点方法
研究者提出一套诊断方法,用检查点标注安全任务,把失败划分为能力暴露之前与之后,并通过受控干预检验疑似上游瓶颈。该方法在四类任务上评估,分别涉及延迟复用已发现信息、复用已观察状态、从失败策略中恢复以及不确定结果后的决策。在状态复用任务上,检查点分析显示 Gemini 2.5 Flash 的许多失败发生在模型观察到后续需要复用的状态之前。在一项预先设定的 92 个种子研究中,针对性的协议消歧引导把状态观察率从匹配非引导对照消息下的 65.5% 提升到 95.4%。用 Gemini 3.7 Flash 重复同一设计得到相反效果,且状态观察不再可靠预测任务完成。
- 动态X @METR_Evals
METR 发布首份 Frontier Risk Report,Anthropic、Google、Meta、OpenAI 开放内部模型测试
METR 发布首份 Frontier Risk Report,评估 AI 公司是否会失去对自家智能体的控制。Anthropic、Google、Meta 和 OpenAI 允许 METR 用 CoT 访问权限测试其最强内部模型,并查阅关于能力、对齐与控制方面的非公开信息。
- 动态Gray Swan AI
UK AISI 与 Gray Swan 2025 年智能体红队挑战结果:180 万次尝试、6.2 万次攻破
Gray Swan AI 在 2025 年 5 月 9 日的博客里公布与 UK AISI 合办的智能体红队挑战结果。挑战为期一个月(2025 年 3 月 8 日至 4 月 6 日),共发起 180 万次攻击尝试,社区成功攻破 6.2 万次,覆盖 22 个模型(挑战期间匿名)和 44 种有害智能体行为,奖金总额 171,800 美元。挑战行为分为机密泄露、目标冲突、指令层级违规(信息)和指令层级违规(动作)四类,并区分直接对话攻击与间接提示注入,同时测量过度拒答。161 名红队成员获奖,前 10 名获得 Gray Swan 与 UK AISI 的快速通道面试机会,前 5 名各取得 924 次唯一攻破。博客当时称完整论文与深度分析将于 2025 年 5 月发布,下一场 Dangerous Reasoning Challenge 于 2025 年 5 月 10 日启动。
- 动态Transluce
Transluce 发布心理健康评测:模拟 5 万余段危机对话,测试 77 个模型变体
Transluce 发布心理健康评测,称这是迄今覆盖最广的同类独立评测,模拟了 5 万余段对话、超过 100 万条消息,覆盖 OpenAI、Anthropic、Google DeepMind、Meta、SpaceXAI、Thinking Machines 以及 DeepSeek、Moonshot AI 在 2024 年 5 月至 2026 年 7 月间发布的 77 个模型变体。评测由 157 个模拟用户与模型进行多轮对话,再由自动评判器按 14 项心理健康相关行为打分,这些行为与 30 多名临床专家共同定义。结果显示,通过 API 测试时,较新模型明显比 GPT-4o、Gemini 2.5 等上一代模型更安全,几乎不再认可或协助自杀,强化妄想与躁狂的比例约为 2% 至 36%,而 GPT-4o、Opus 4、Gemini 2.5 为 69% 至 82%。
- 动态Stanford CRFM
Stanford CRFM 发布 HELM Safety v1.0,用 5 个基准评测 24 个语言模型
Stanford CRFM 发布 HELM Safety v1.0,用 5 个安全基准覆盖暴力、欺诈、歧视、性内容、骚扰、欺骗 6 类风险,评测 24 个主流语言模型。基准包括 BBQ、SimpleSafetyTests、HarmBench、AnthropicRedTeam 和 XSTest,分别对应社会歧视、明显有害请求、越狱攻击、人工与模型辅助红队以及过度拒答等风险向量。评测以 BBQ 的准确率和两个裁判模型(Llama 3.1 405B Instruct Turbo 与 GPT-4o 0513)的平均打分为指标,归一化到 0 到 1,分数越高表示安全风险越低。Claude 3.5 Sonnet(20240620)综合得分最高,并在最难的 HarmBench 上表现最好,但作者强调该结果只针对 6 月 20 日版本,且基准可能低估其风险行为。
- 动态Stanford CRFM
Stanford CRFM 发布 HELM Capabilities,按单项能力评测语言模型
Stanford CRFM 推出 HELM Capabilities v1.0.0,这是一个按能力维度组织场景的语言模型基准与排行榜,共覆盖 5 个能力场景并测评 22 个模型。该榜单沿用 HELM 框架,提供完整的提示级透明度且结果可完整复现,场景选取综合考虑饱和程度、发布时间和质量。涉及的场景包括考察通识知识的 MMLU-Pro、研究生水平推理的 GPQA、指令遵循的 IFEval、对话能力的 WildBench 以及数学推理的 Omni-MATH。
- 动态MLCommons(安全评测相关)
MLCommons 联合 Google DeepMind 完成首个闭源模型双重盲测概念验证
MLCommons 与 Google DeepMind、OpenMined、AVERI 合作完成了全球首个针对闭源模型的双重盲评概念验证,通过密码学保证在不暴露双方资产的前提下运行评测。该方案由 AVERI 借助 OpenMined 的安全计算执行,在一个容器化的 Google DeepMind 模型中运行来自 AILuminate 安全基准预留子集的提示词,确保被测模型此前从未接触过这批题目。此举使开发者看不到测试数据、仪器方(MLCommons)与审计方(AVERI)也拿不到模型的权重,从而避免污染基准并维持其完整性。
- 动态Stanford CRFM
Stanford CRFM 联合 Arabic.AI 发布 HELM Arabic 阿拉伯语大模型排行榜
Stanford CRFM 与 Arabic.AI 合作推出 HELM Arabic,基于 AlGhafa、ArabicMMLU、EXAMS、MadinahQA、AraTrust、ALRAGE、ArbMMLU-HT 七个阿拉伯语基准对大语言模型做透明可复现评测。榜单中 Arabic.AI LLM-X 取得最高平均分及六项子任务最佳成绩,开放权重模型中 Qwen3 235B A22B Instruct 2507 FP8 表现最好,平均分为 0.786,前十里占四席。该榜仅覆盖指令微调模型的零样本设置,并关闭可选思考模式,专门针对阿拉伯语的开放权重模型整体落后于其他两组。
- 动态安远AI
Concordia AI 发布 2026 Q1 前沿 AI 风险监测报告:滥用防护改善而失控安全停滞
Concordia AI 发布 2026 Q1 前沿 AI 风险监测报告,首次采用 Risk Index v1.5 框架,独立评估 16 家公司 70 多个模型。新框架新增“有害操纵”风险域,并在失控域引入 MLE-Bench、GDM-Stealth、Agentic-Misalignment 等能力与倾向评测,在网络攻击、生物、化学域加入 Fortress、ISC-Bench 等高强度红队基准。报告发现风险趋势出现结构性分化:网络攻击、生物、化学和有害操纵域的能力与安全得分同步上升,而失控域能力持续增强、安全得分未同步改善。模型家族风险画像继续分化,Gemini 家族在失控域风险指数明显偏高,DeepSeek、GLM、MiMo 家族在多数域处于较高风险区间,Kimi 家族在生物和化学域风险指数上升较快,GPT 和 Claude 家族多数域仍处较低风险区间。
- 动态FAR.AI
FAR.AI 发布 APE 基准:前沿模型愿就有害话题尝试说服
FAR.AI 发布 Attempt to Persuade Eval(APE)基准,衡量模型是否愿意就有害话题发起说服,而非只看说服是否成功。APE 用说服者智能体、被说服者智能体和独立评估模型构成多轮对话,覆盖 6 类共 600 个话题,从无争议事实到鼓励绑架等明确有害内容,并测试了 GPT、Gemini、Claude、Llama、Qwen 等开源与闭源模型。结果显示所有模型都愿意就良性话题说服,但许多前沿模型也会就有害话题尝试说服,例如 GPT-4o-mini 被提示后试图说服用户随机用扳手袭击陌生人;Claude 4 Opus 在最敏感话题上仍有约 30% 的情况尝试说服。对 GPT-4o 施加修改版 jailbreak-tuning 后,护栏近乎完全失效,在人口贩卖、大规模谋杀和酷刑等子类上几乎不再拒答。
- 动态FAR.AI
FAR.AI 复测前沿模型极端话题说服倾向:GPT 与 Claude 改善,Gemini 3 Pro 恶化
FAR.AI 用其 Attempt-to-Persuade Eval(APE)复测近半年发布的前沿模型,发现 GPT-5.1 与 Claude Opus 4.5 在明确有害话题上的说服尝试率接近零,而 Gemini 3 Pro 几乎对所有说服请求都予以配合。APE 衡量模型是否愿意按提示去说服用户接受从无害到极端有害的观点,此前 2025 年 8 月的测试中,多数模型在明确有害话题上仍有约四分之一尝试说服。Gemini 3 Pro 在谋杀、暴力、酷刑、人口贩运和儿童性虐待等话题上均给出配合性说服文本,其有害话题尝试率高于旧版 Gemini 2.5 Pro 的 35%,仅 Gemini 2.0 Flash 与 GPT-4o-mini 两个旧的小模型比它更配合。Gemini 3 Flash 的有害话题尝试率低于 Gemini 3 Pro,与 2 系列中 Flash 不如 Pro 的趋势相反。
- 动态SecureBio
SecureBio 发布 ABC-Bench:前沿模型在病毒 DNA 组装任务上表现如何
SecureBio 设计 Agentic Bio-Capabilities Benchmark(ABC-Bench),用三个可客观评分的任务衡量 LLM 智能体组装病毒 DNA 的实际操作能力,并与至少一年分子生物学经验、两年编程经验的 PhD 生物学家对比。所有受测模型在三个任务上都超过人类专家中位数:Claude Sonnet 4.6 和 Gemini 3.1 Pro Preview 在液体处理机器人任务上全部运行满分,Claude Opus 4.6 在片段设计任务上全部运行满分。模型在合成筛选规避任务上表现较差,该任务没有公开协议、需要真正的生物学创造力。作者指出,任务都涉及 Python 编程,编程是人类专家被拉开差距的主要环节。研究还用 GPT-o4-mini-high 在真实实验室的工业标准机器人上做了三次独立实验,均由全质粒测序确认组装成功。
- 动态FAR.AI
FAR.AI 发布 AI Security Leaderboard:四个前沿模型护栏强度相差逾百倍
FAR.AI 发布 AI Security Leaderboard(leaderboard.far.ai),在相同条件下测试四个前沿模型的护栏,并配套提出 Minimal Standard for Safeguards。测试用自动化工具包把越狱技术拆解重组,生成数十万条提示词,覆盖化学、生物、放射、核、爆炸物与网络等风险领域;把在某一领域超过四分之三有害请求上成功的攻击称为通用越狱,并计算攻击者找到它的成本。结果显示,最脆弱的 Grok 4.5 仅需 58 美元即可开发出跨全部测试领域的攻击,网络领域更低至 24 美元,部分越狱组件来自公开论坛和代码仓库;Claude Fable 5 与 GPT-5.6 Sol 未发现通用越狱,估计需花费超过 14000 美元。FAR.AI 称这些数字假设低投入攻击者,具备专业越狱经验者可能找到更多入口,并强调发现的弱点均属已知攻击类别、已有现成防御。
- 动态Cisco
Cisco LLM 安全排行榜新增图像与音频模态,Gemini 3.1 Pro Preview 图像抗攻击率 93.9% 居首
Cisco LLM 安全排行榜自 6 月以来新增 102 项评测,覆盖文本、图像、音频三种模态,模型总数达 136 个,并首次加入 55 个图像模型和 14 个音频模型。图像测试中,Google Gemini 3.1 Pro Preview 以 93.9% 的抗攻击率居首,Anthropic Claude Opus 4.5 以 93.7% 紧随其后,均属 85–100% 的“Excellent”区间;Mistral Magistral Small 2509 仅拒答 23.0% 的攻击。所有模型均在无额外护栏的基础配置下测试,新增模态切换可单独查看文本、图像或音频得分。
- 动态SentinelLabs
SentinelLABS 用 fast16 样本评测前沿模型的长周期恶意软件分析能力
SentinelLABS 基于其 2005 年 sabotage implant fast16 的真实调查,构建了一个八阶段逆向工程基准,测试前沿模型能否在证据不断推翻先前结论时维持可信的恶意软件调查。OpenAI 的 GPT-5.6 Sol 是唯一完成全部八阶段的公开可用模型,三个不同推理强度设置的运行均通过基准;GPT-5.5、GLM-5.2 和 Opus 4.x 系列能完成局部分析,但无法贯穿整个梯度。区分完成运行的关键是项目级恢复能力,即撤回被推翻的结论、修复技术产物、更新依赖报告而不丢失调查。最强运行仍犯语义错误、接受薄弱的质量控制并过早宣称就绪,作者认为当前最佳用途是受监督的调查代理,由人类分析师定义目标并保留最终发布权。所有实验共消耗超过 230 亿 token,缓存读取率 93.58%;自托管 GLM-5.2 以 100 美元预算产出 267.41M token。