跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 588 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源202新闻与研究603细分与主体7来源:Cisco TalosCisco Talos1 条材料来源:SecureBioSecureBio5 条材料动态:Cisco Talos 测试 66 种模型与推理组合,为 AI SOC 选型提供可复用方法动态2026-08-26Cisco Talos 测试 66 种模型与推理组合,为 AI SOC 选型提供可复用方法动态:从 Claude Mythos 到 Fable:为何需要在“Bio Mythos”时刻前建立生物安全保证基础设施动态2026-07-10从 Claude Mythos 到 Fable:为何需要在“Bio Mythos”时刻前建立生物安全保证基…动态:SecureBio 发布 BioTIER 基准,评测 52 个模型的生物安全护栏有效性动态2026-07-16SecureBio 发布 BioTIER 基准,评测 52个模型的生物安全护栏有效性动态:SecureBio 发布 GPT-5.6 Sol 生物滥用风险预发布测试报告动态2026-07-23SecureBio 发布 GPT-5.6 Sol 生物滥用风险预发布测试报告动态:SecureBio 评审 Anthropic 未删节化生风险报告:Claude Opus 4.6动态2026-07-28SecureBio 评审 Anthropic 未删节化生风险报告:Claude Opus 4.6动态:SecureBio 评测 Kimi K3 生物能力:BCI 142,危险提示拒答率仅 26.9%动态2026-08-07SecureBio 评测 Kimi K3 生物能力:BCI142,危险提示拒答率仅 26.9%方向:前沿安全框架前沿安全框架1方向:AnthropicAnthropic3方向:OpenAIOpenAI2方向:安全评测安全评测6方向:其他方向其他方向4方向:防御与护栏防御与护栏2方向:危险能力危险能力5
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。6 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态Cisco Talos

    Cisco Talos 测试 66 种模型与推理组合,为 AI SOC 选型提供可复用方法

    Cisco Talos 用 EvidenceForge 1.12.0 生成的 80,054 条模拟日志,对 Anthropic 和 OpenAI 的 66 种模型与推理组合做工具辅助日志分析测试,未找到单一最优模型,而是总结出一套可复用的评估方法。测试发现推理投入并非通用的质量调节旋钮,投入更多常只增加成本而不改善结果,有时反而拉低分数;一致性应作为关键决策因素,中位数高的条件仍可能偶发弱结果。Talos 建议选型时综合权衡调查质量、成本、速度、一致性与失败率,而非只看最高分。

  • 动态SecureBio

    从 Claude Mythos 到 Fable:为何需要在“Bio Mythos”时刻前建立生物安全保证基础设施

    Anthropic 的 Claude Mythos 因能识别并利用电网、金融网络和医院系统等关键基础设施软件的弱点,将 AI 网络能力风险推上美国政策议程首位,Anthropic 提前向部分企业和政府机构开放早期访问以便防守方加固系统。两个月后 Fable 面向公众发布引发担忧其防护栏可能被绕过,商务部据称给 Anthropic 90 分钟禁止外国国民访问,导致该模型全球下线,此后限制虽解除但仍可重新施加。由于生物能力的危险性更难观察衡量且具有自我复制和进攻主导特性,若缺乏生物安全保证基础设施,“Bio Mythos”时刻可能同样招致被动应对。

  • 动态SecureBio

    SecureBio 发布 BioTIER 基准,评测 52 个模型的生物安全护栏有效性

    SecureBio 发布 BioTIER(Biological Targeted Information for Exclusion and Refusal)基准,通过拒答行为衡量 AI 模型在生物领域安全与可用性之间的平衡。该基准包含 542 条由 15 位博士级专家撰写并经三轮共识验证的提示词,分为灾难规避(CA,249 条)、生物医学两用研究关切(BD,149 条)和良性相关生物学(RB,144 条)三档风险域,并拆分为 BioTIER-refuse 与 BioTIER-permit 两个评测组件。研究覆盖 10 家开发商的 52 个模型,时间跨度从 2022 年到 2026 年。在 BioTIER-permit 上结果较为一致,几乎所有模型都回答了几乎所有良性查询,最低仍有 75%。研究还发现过度拒答多发生在风险边界附近,而非真正良性的生物学问题。

  • 动态SecureBio

    SecureBio 发布 GPT-5.6 Sol 生物滥用风险预发布测试报告

    SecureBio 对 OpenAI 最新旗舰模型 GPT-5.6 Sol 开展生物滥用相关能力的预发布测试,测试期间关闭了 OpenAI 系统级的生物风险内容过滤器。在四项知识基准中的三项上,GPT-5.6 Sol 得分超过此前测试过的所有模型,也高于各基准上的人类专家;在 World-Class Bio 上得分为 68%,比 GPT-5.5 高约 9 个百分点。在智能体基准上,它在 ReproBAIT 中平均复现出原工具 82% 的已发表性能,在蛋白设计工作流 ABLE 的每个愿意尝试的任务上表现最佳,但拒绝了最高层级的规划步骤。关闭护栏的 railfree 版本在 DNA 合成筛查规避任务上取得新高分,能稳定找到一种可绕过商业筛查算法的方法,但实际执行对恶意行为者并不方便;受护栏保护的发布候选版本则直接拒绝该任务。

  • 动态SecureBio

    SecureBio 评审 Anthropic 未删节化生风险报告:Claude Opus 4.6

    SecureBio 与 Anthropic 合作评审了其 2026 年 2 月风险报告的化学与生物(CB)风险章节,Anthropic 提供了未删节版本及 110 页补充材料,并在两个月内回应了七十多个后续问题。SecureBio 认同 Anthropic 的总体结论:Claude Opus 4.6 大幅促成灾难性结果的当前风险,在非新型 CB 武器生产上为“极低但不可忽略”,在新型 CB 武器生产上为“低风险但存在较大不确定性”。评审发现,作为主要 CB 风险护栏的拒答分类器在 SecureBio 的 BioTIER-refuse 基准上拒绝了 94.2% 的危险提示词,但建议随生物技术进展持续更新其训练宪法。评审还审查了用户豁免审查与监控流程,认为威胁行为者借此大幅提升 CB 武器生产的可能性不大但存在。SecureBio 表示此项工作未接受 Anthropic 资助。

  • 动态SecureBio

    SecureBio 评测 Kimi K3 生物能力:BCI 142,危险提示拒答率仅 26.9%

    SecureBio 对 Moonshot AI 的 Kimi K3 做了生物能力与护栏评测,其 Bio Capabilities Index(BCI)得分为 142,在已评测模型中排第七,相当于闭源前沿约 8.1 个月前的水平。知识基准上,Kimi K3 在 Virology Capabilities Test 得 46.7%、Molecular Biology Capabilities Test 得 58.4%、World Class Biology 得 55.0%、Human Pathogen Capabilities Test 得 58.5%,在 MBCT、WCB、VCT 上取得开源权重模型最高分,HPCT 则落后于 GLM-5.2 的 65.3%。

  • 动态SecureBio

    SecureBio 发布 VCT-v2 病毒学能力测试,移除 43 道题并编辑 163 道

    SecureBio 更新其旗舰病毒学能力测试 VCT,发布更抗捷径的 VCT-v2,共 279 道题。审计确认多数题目科学有效且基准未饱和,但为提升有效上限,团队用确定性标准标记可疑题目并由病毒学专家人工复核,最终移除 43 道(13.4%)题目(含 25 道无区分度的简单题)、编辑 163 道(50.6%),116 道保持不变。测试模型在 VCT-v2 上的准确率比 VCT 下降 1.0 至 7.1 个百分点,最强与最弱模型间差距基本保持(26.6% 对 26.1%),人类专家基线仍约 21%。标记流程发现 87/322(27.0%)道题可被模型在缺少图片或题干的情况下答对,VCT-v2 显著降低了这类捷径利用。作者估计 VCT-v2 的有效上限不低于 79%,高于 VCT 的 23 个百分点余量,并建议将基准维护作为持续工作、加入捷径抵抗检查。

  • 动态SecureBio

    SecureBio 发布 GPT-6 Astra 发布前生物风险评测报告

    SecureBio 对 OpenAI 于 2026 年 9 月 3 日公开发布的旗舰模型 GPT-6 Astra 做了发布前生物滥用能力评测,测试了带与不带系统级生物护栏的版本。在知识基准上,Astra 在 VCT 和 VCT-v2 上超过此前所有被测模型,相对 GPT-5.6 Sol 分别提升 4.3 和 8 个百分点,比人类专家基线高 30 多个百分点;HPCT 得分与 GPT-5.6 Sol 接近,WCB 得分为 61.6% ± 0.6%,低约 7 个百分点,报告认为这主要源于模型更倾向于含糊作答而非知识缺口。在智能体基准上,Astra 在 ReproBAIT 达到已发表性能的 80-83%(GPT-5.6 Sol 为 63-69%),是首个能生成满足 in silico 可设计性阈值的 de novo 蛋白质设计的模型;无护栏版本还首次完整给出规避 DNA 合成筛查的复杂策略。

  • 动态SecureBio

    SecureBio 谈如何评测超越人类水平的生物能力

    SecureBio 的 Shiv Muthupandiyan 指出,前沿 AI 模型在生物安全相关能力上已超过人类专家,评测必须从测试代理指标转向测试真实技能,但生物领域无法像国际象棋那样直接对弈,也不能像网络安全那样在真实代码中验证漏洞。文中给出的数据是,前沿模型在 Virology Capabilities Test(VCT)上的准确率在 2024 年初超过专家中位数 22%,在 2026 年超过最佳专家 50%,并在高难度生物学问题上得分是世界级专家的三倍。作者认为,超越人类前沿后分数不再对应可解释的现实能力,而直接测试双重用途生物技能本身就可能制造信息危害。可行的路径是组合可独立验证的窄任务,例如预测蛋白质折叠或抗病毒药物效果、设计无害生物产物,并观察相邻领域的信号,包括 LLM 智能体加速科研带来的能力提升,以及 AI 助长的复杂犯罪和极端暴力案件是否增加。

  • 论文Hugging Face Daily Papers

    BIABench:评测 AI 智能体在真实生物图像分析任务上的表现

    研究者提出 BIABench,一个由 16 个已发表生物学研究重建而成的基准,保留原始科学问题、成像数据和真值,用于评测 AI 智能体能否端到端完成真实生物图像分析。任务覆盖 11 类分析子任务和从 H&E 组织学到单分子定位显微镜的多种模态,因为 2D 图像、3D 体数据和延时序列往往过大无法直接作为上下文读取,智能体必须通过代码、专用软件和渲染视图来选择并执行分析。每个提交同时获得结果分(用领域标准指标比对输出文件与真值)和过程分(由视觉语言模型按专家撰写的评分细则评判方法选择与质量控制)。评测涵盖通用与生物学专用智能体及多个语言模型,每个任务重复运行:常规二维任务解决得较好,但在加入第三维或时间轴的任务上,没有智能体得分超过 0.19,生物学专精、更强的模型和详细专家指令都未能缩小这一差距。BIABench 已连同数据和代码开放发布。

  • 论文arXiv

    MASCRDM:面向大语言模型训练过程的合规风险检测与缓解多智能体系统

    MASCRDM 是一套在大语言模型训练全过程中实时检测并缓解合规风险的多智能体系统。它依据现有 AI 法律构建合规规则集,并在合规法律专家指导下训练专用合规 LLM,再通过合规知识图谱将模型拆解为多个组件、定位关键节点,在训练中向开发者给出风险告警与建议。在歧视与偏见基准上的实验显示,该方法能有效提升合规性,同时保持合理的语义性能。

  • 论文arXiv

    Drift-Bench++:在沟通失误与意图漂移下评测交互式意图对齐

    研究者提出交互式意图对齐这一任务设定,指出现有基准普遍假设用户能准确、充分地表达固定意图,而现实中用户会误传、改变目标并失去耐心。为此他们构建 Drift-Bench++,一套面向可验证可执行任务的基准构建流程,可控制错位程度与意图漂移,并配套有限耐心、多样模拟用户和静默的交互条件漂移协议。作者还提出 GRIP 评测协议,覆盖任务落地、用户真实性、提问有效性和对意图变化的适应。在多种环境、模型和交互条件下,更强的交互始终有帮助,但距离 oracle 表现仍有明显差距;在已部署的 ProdAgent 会话上的验证显示,所建模的失败在真实部署中普遍且影响显著。

  • 论文论文追踪

    研究提出 IRT 框架拆解大模型跨语言安全护栏退化

    研究者提出多组项目反应理论(IRT)框架,把跨语言安全表现拆解为语言无关的安全鲁棒性、提示词固有难度、全局语言处理难度和提示词特定的跨语言安全差距四个潜在变量,以替代把多种因素混在一起的越狱成功率(JSR)。基于 MultiJail 数据集,团队评估了 5 个闭源模型家族共 61 个模型配置、10 种不同资源水平的语言,汇总 190 万条回复。探索性因子分析显示安全主要是一维的,模型拒答不同危害类型主要依赖共享机制。与低资源语言安全更差的预期相反,22 个模型配置在英语下比在低资源语言下更易被攻破;低资源语言产生的不确定回复(高熵)更多。高跨语言安全差距的提示词集中在 Theft、Weapons 等物理危害类别和较低资源语言中,该趋势通过跨数据集泛化得到验证。

  • 论文论文追踪

    TraceSafe-Bench:评估 LLM 护栏在多步工具调用轨迹上的表现

    研究者提出 TraceSafe-Bench,用于评估 LLM 护栏在多步工具调用中间轨迹上的安全性,覆盖提示注入、隐私泄露、模型幻觉、接口不一致等 12 类风险,包含 1000 多个执行实例。团队评测了 13 个 LLM-as-a-guard 模型和 7 个专用护栏,得到三点结论:护栏效果更多取决于结构化数据处理能力(如 JSON 解析),与结构化到文本基准强相关(ρ=0.79,p<0.01),而与标准越狱鲁棒性无关联;轨迹检测准确率不随模型规模单调提升,通用 LLM 持续优于专用安全护栏;在原生上下文范围内检测准确率随轨迹变长而提升,但在极端长上下文场景下因过度拒答而下降。该工作已被 COLM 2026 接收。

  • 论文arXiv

    从 RobustReview 基准到 SciCore:AI 审稿人的修辞鲁棒性评测

    研究提出"修辞鲁棒性"(Rhetorical Robustness),要求 AI 审稿人对内容不变但措辞改写的稿件给出稳定评分,同时保持对不同论文的区分度。为此构建了包含 1,260 个稿件版本的全稿基准 RobustReview,评测 30 种审稿人配置,发现存在"虚假鲁棒性"——改写敏感度低与跨论文评分崩塌同时出现,且人类对齐与修辞鲁棒性的审稿人排名并不一致。据此提出双分支审稿人 SciCore,将全稿判断与结构化"科学内核"判断取平均,在 GPT-5.5 对比中取得领先的稳定性-区分度综合表现,并保持有竞争力的人类对齐。

  • 论文arXiv

    Hack-Verifiable Terminal Bench:评测终端任务中的奖励作弊

    研究者将 hack-verifiable environments(HVE)方法移植到 Terminal Bench,提出 Hack-Verifiable Terminal Bench(HVTB),用于自动、可靠地识别智能体在终端与编码任务中的奖励作弊。该方法把可检测的作弊行为嵌入任务中,避免依赖人工检查或 LLM 评判。作者用 HVTB 测量了多个前沿模型的奖励作弊率,并研究提示词中提供不同数量作弊信息能否缓解该行为,从而检验提示能否阻止提示未预料到的未知未知型利用方式。所有环境和智能体轨迹已公开。

  • 论文Hugging Face Daily Papers

    RegLLM:面向受监管智能体 AI 的有限自主性诊断测试框架

    研究者提出 RegLLM,一个面向受监管智能体工作流的有限自主性诊断测试框架,监测引用有效性、来源接地、schema 合规、升级正确性、宪法对齐和不安全动作率六项可信度信号。离线参考运行(n=12)在启用治理后将升级召回率从 0 提升至 0.67,不安全动作率从 0.33 降至 0.08。两个单 GPU Qwen2.5-3B LoRA/DPO 试点(n=8)显示配置差异可压过调优效果,尚不足以证明适配器效果或生产可用性。

  • 论文arXiv

    10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    10a Labs 对 2024 年 1 月至 2026 年 3 月初 HuggingFace 与 GitHub 上的无审查开源模型生态做了全链路测绘,识别出 3,471 个原始无审查模型和 8,164 个压缩再分发版本。每个原始模型平均被重新打包 2.4 次,三个再分发者(mradermacher、Triangle104、RichardErkhov)占全部压缩再分发的 52%,huihui-ai 的 192 个原始模型衍生出约 1,800 个下游重打包。生产端与再分发端基本分离,至少 1,055 个生产者和 1,011 个再分发者中仅 24% 重叠。GitHub 上识别出 1,643 个集成无审查模型的应用,其中 25% 被判定为明确恶意,Dolphin 系列单独支撑 30% 的应用,43% 的应用 README 提到 Ollama。

  • 论文arXiv

    PlanBench 评测:o1 规划能力大幅提升但仍未饱和

    作者用 2022 年发布的 PlanBench 基准评测 OpenAI 的 o1(Strawberry)在规划任务上的表现,发现其成绩相比此前 LLM 有数量级提升并领先同类模型,但远未饱和该基准。文章指出,GPT3 之后众多闭源与开源 LLM 在该基准上的进展一直缓慢,而 OpenAI 称 o1 是专门训练以突破自回归 LLM 常规限制的新型大推理模型(LRM)。作者认为这一提升同时引出准确率、效率与保证等问题,需要在部署此类系统前加以考虑。

  • 论文arXiv

    通过心理测量画像衡量大语言模型的行为特征

    研究团队开发了一套跨语言心理测量画像框架,用七种心理量表评估九个 LLM,中英文各重复施测五次,未解决的题目保留为 NA。模型呈现结构化的、模型特异的画像,同时共享一种对齐塑造的模式:亲社会与自我调节反应更高,支配性、脱离和有害意图认同更低。NA 反应呈结构化分布,语言条件和提供方来源与画像配置及可作答性相关,重复施测显示高可复现性并可还原模型身份。

  • 论文arXiv

    多模态大模型能否生成并检测社交媒体多模态假新闻

    研究提出一个由故事智能体、图像智能体和评论智能体协作的多智能体框架,用于生成能与真实新闻对抗的虚假社交媒体帖子。作者用该框架在科学、健康、娱乐三个领域生成了超过 9000 组配对的多模态新闻帖子,并以此评测 16 个开源与闭源多模态大语言模型的自动检测能力。结果显示,多数模型的准确率明显低于人类水平,在识别图像真实性方面尤其失败。作者称该工作为开发针对社交媒体假新闻的防御提供了基础,代码与数据已在 GitHub 公开。

  • 论文arXiv

    SWE-Prometheus:衡量真实代码仓库工程治理改进的基准

    SWE-Prometheus 是面向仓库级工程治理改进的基准,每个任务给出固定快照与开放式目标,要求智能体自行识别风险、排定干预优先级并验证改动,从六个治理维度通过配对证据、干净环境探针、行为门控和两名独立教师评分进行评估。基准包含 60 个仓库,10 个模型在共享的 22 仓库公开子集上平均 NGI 为 0.0568 至 0.5760,观测到的行为破坏率为 0% 至 23%。

  • 动态Jev Gateway Study

    Jev 与开源决策模型的提示注入检测器基准测试

    该基准在同一台 Apple M4 机器上对比 Jev 1.13.0、Kev-4B、Kev-0.8B、Laya、GLiNER2.5-Decide、ProtectAI DeBERTa、Prompt Guard 2 和关键词规则在文档块注入与用户消息越狱两类任务上的表现。文档块测试中 Jev AUC 为 1.00、冻结阈值下召回 100%、误报 8%,Kev-4B 为 0.90 和 70%,Prompt Guard 2 为 0.83 和 19%;对不直接提及 AI 的隐蔽攻击,Jev 召回 97%,Kev-4B 62%,三个专用注入分类器接近随机水平。在 220 条 LLMail-Inject 真实人类攻击上,Jev 捕获 95%、误报 0%,Kev-4B 捕获 86%、误报 1%;作为邮件助手时 gpt-oss-120b 有 20/220 向攻击者地址发送邮件,Jev 前置时 0 条通过。

  • 论文arXiv:可解释性

    用自动化可解释性增强视觉异常检测

    研究用自动化可解释性增强视觉异常检测器:将 PatchCore 最近正常残差经稀疏自编码器(SAE)分解为稀疏特征,由多模态 LLM 描述并标注为异常、干扰或不确定,再据此抑制干扰特征、放大异常特征并重建 patch 嵌入重新打分。在四个基准的 40 个类别上,联合干预使宏平均图像级 AUROC 从 0.8724 升至 0.8857,合成损坏下从 0.8066 升至 0.8210;在 RobustAD 三个类别上,源数据从 0.8745 升至 0.9056,真实采集偏移下从 0.6069 升至 0.6599。