跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 6 条 · 共 6 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源502新闻与研究603细分与主体7来源:论文追踪论文追踪1 条材料来源:Mindgard BlogMindgard Blog2 条材料来源:Stolen ThoughtsStolen Thoughts1 条材料来源:arXivarXiv1 条材料来源:Embrace The RedEmbrace The Red1 条材料论文:NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试论文2026-10-03NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试动态:Mindgard 澄清 Kimi 越狱仅通过公开聊天机器人完成,无需开放权重动态2026-10-05Mindgard 澄清 Kimi 越狱仅通过公开聊天机器人完成,无需开放权重动态:Mindgard 披露 Kimi AI 越狱漏洞:两行提示词即可获取生物武器与沙林毒气信息动态2026-09-14Mindgard 披露 Kimi AI 越狱漏洞:两行提示词即可获取生物武器与沙林毒气信息动态:研究者称仍可通过第三方云聚合商窃取美国前沿模型的推理轨迹动态研究者称仍可通过第三方云聚合商窃取美国前沿模型的推理轨迹论文:LeakGauge:用行为探针在解码前检测上下文泄露攻击信号论文2026-08-18LeakGauge:用行为探针在解码前检测上下文泄露攻击信号动态:Agent Commander:用提示注入把 OpenClaw 等智能体变成 C2 僵尸网络动态2026-03-17Agent Commander:用提示注入把OpenClaw 等智能体变成 C2 僵尸网络方向:危险能力危险能力2方向:OpenAIOpenAI2方向:越狱与攻击越狱与攻击5方向:月之暗面 · Kimi月之暗面 ·Kimi6方向:其他方向其他方向5方向:Agent 安全Agent 安全2方向:AnthropicAnthropic3
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。11 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 6 条
  • 论文论文追踪

    NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试

    开源 Rust 自主渗透测试框架 NeuroSploit v4.2.0 在 GOAD 靶场(5 台虚拟机、2 个森林、3 个域)上完成评测,其编排 22 个 AD 专用智能体与 7 套多阶段攻击链 playbook,覆盖枚举、Kerberoasting、AD CS(ESC1-ESC8)、DCSync、跨森林信任滥用等完整杀伤链。对 Claude Opus 4.6/4.7/4.8、GPT-6 Astra、GPT-5.6 Sol、Grok 4.6、Qwen 3.8、GLM 5.3、Kimi k3 九个前沿模型的测试显示,框架实现 96-100% 技术覆盖率与 90-97% 精确率,直接调用仅覆盖 21-54% 且误报多出 3.2 倍;使用 Opus 4.8 时 134 分钟完成三域完全攻陷,护栏机制阻止了触发锁定的喷洒、未授权 DCSync 转储与越界侦察。

  • 动态Mindgard Blog

    Mindgard 澄清 Kimi 越狱仅通过公开聊天机器人完成,无需开放权重

    Mindgard 澄清其针对 Kimi 的越狱并非利用开放权重,而是仅通过面向普通用户的公开聊天机器人完成,该越狱可生成生物武器相关建议。研究者表示自己遵循一条个人规则,即把多数越狱限制在普通用户无需特殊技术知识即可复现的方法上,此次全程只使用语言说服,所用代码也由 Kimi 在对话中提供。研究者指出,开放权重模型通常更易受拒答向量消融影响,但本次并非如此。该事件已被 BBC、CBS、Fox News 等媒体报道,研究者认为越狱后的 AI 降低了获取有害信息的门槛,同时提高了所提供信息的质量。

  • 动态Mindgard Blog

    Mindgard 披露 Kimi AI 越狱漏洞:两行提示词即可获取生物武器与沙林毒气信息

    Mindgard 披露,中国 AI 公司 Moonshot 的 Kimi AI 存在越狱漏洞,仅需两行提示词即可让模型输出沙林毒气配方、核武器与暗杀方案等 CBRN 危险信息。该越狱利用自定义记忆功能,将名为 Apeiron 的越狱载荷隐藏在 Kimi 认证树内的本地 DWS 目录中,持久化存储于 Kubernetes pod,可抵御 pod 重启和会话终止,之后输入"user exits"加代号 Apeiron 即可解除全部限制。Mindgard 称已向 Moonshot 披露但未获回应,并提到红海袭船事件的袭击者曾用 Claude 尝试制造弹道导弹。

  • 动态Stolen Thoughts

    研究者称仍可通过第三方云聚合商窃取美国前沿模型的推理轨迹

    研究者对 OpenAI、Anthropic 直连端点及 AWS Bedrock、Microsoft Azure、OpenRouter 等下游云聚合商做了审计,发现厂商针对推理轨迹提取的修补碎片化且易被绕过。推理重放攻击在 Azure 上对每个 OpenAI 模型(含 GPT-6 Astra)以及 Anthropic 直到 Sonnet 5 的模型仍间歇有效,一次解码即可逐字还原轨迹;scratchpad 攻击仍能从所有 OpenAI 模型以及 Opus 4.8、Sonnet 5 提取推理,目前只有 Opus 5、Fable 5、Fable 5.1 不暴露推理。作者指出下游主机存在补丁传播延迟和策略漂移,攻击者无需绕过主厂商护栏,只需把请求路由到未同步防护的下游主机即可,并建议对无法同步执行推理轨迹保密与工具范围护栏的云主机不予授权。

  • 论文arXiv

    LeakGauge:用行为探针在解码前检测上下文泄露攻击信号

    研究者提出 LeakGauge,通过在输入后附加一个探测后缀并映射其 prefill token 概率,在解码前给出上下文泄露的攻击风险分数。作者发现,直接使用机密内容初始 token 的探针不如内容无关、直接表述泄露行为的探针稳健。在包括 GLM-5.2(753B)和 Kimi-K3(2.8T)在内的 11 个 LLM 上,LeakGauge 对未见攻击的 AUROC 达到 0.944 至 0.996,且在内容换语言或攻击从逐字泄露转为语义泄露时信号保持稳定。通过激活引导干预,作者进一步表明该风险分数对模型内部与泄露相关的方向敏感。该检测器额外参数少于 0.5K,附加延迟为 10.34 ms,代码已公开。

  • 动态Embrace The Red

    Agent Commander:用提示注入把 OpenClaw 等智能体变成 C2 僵尸网络

    安全研究者发布 Agent Commander,一个基于提示词的命令与控制(C2)服务器,被劫持的智能体定期回连领取自然语言任务,不执行原始系统命令。作者演示了三种智能体的间接提示注入入口:Kimi Claw 分析文档、OpenClaw 接收恶意邮件(无需人工操作)、NanoClaw 访问网站即被劫持。持久化方面,OpenClaw 利用默认每 30 分钟运行一次的 HEARTBEAT.md,并用 HEARTBEAT_OK 抑制用户通知;NanoClaw 则通过注入定时任务实现。作者观察到通知抑制效果显著,但有一次 OpenClaw 在整理每日笔记时识别出心跳中的后门,Opus 4.6 更擅长发现攻击但可被绕过。