全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态Adversa AI
Adversa AI 解析什么是 agent harness 以及如何加固
Adversa AI 发文界定 agent harness 是模型之外让语言模型成为智能体的软件外壳,包括推理循环、工具与 shell 执行器、上下文与记忆管理、审批提示和沙箱,核心公式是 Agent = Model + Harness。文章认为安全边界应落在 harness 而非模型,因为拒答只是模型的偏好,而 harness 拒绝执行才构成控制。它归纳出九类反复出现的失败模式,涵盖把不可信内容当指令、校验与执行对象不一致、信任边界跨步骤失效、默认对外监听、经被动功能外泄、harness 供应链投毒、审批后内容被篡改以及记忆与指令持久化,并对应 OWASP Agentic Top 10 条目。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA 谈安全在 AI 智能体栈中的位置
NVIDIA 的安全团队基于其 OpenShell 及生态合作经验,阐述了新兴 AI 智能体栈中安全的定位问题,指出随着智能体能力增强并运行于更长的时间跨度,将安全与信任内建于其所驱动的应用愈发重要。该视角覆盖智能体栈的各层及其作用,面向开发者、开源项目和合作伙伴提供参考。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA AVO 在 ARC-AGI-3 达到 100%,展示面向长周期自主智能体的前沿级通用架构
NVIDIA 的 AVO 在 ARC-AGI-3 上取得 100% 成绩,其定位是支撑长周期自主智能体的前沿级通用架构。该工作强调前沿语言模型只是 AI 智能体的组件之一,真正决定可靠性的是被称为 harness 的外围系统——它负责模型获取上下文、调用工具、维持状态、响应反馈以及从失败中恢复的方式。
- 动态Google Bug Hunters
Gemini Spark 持久化智能体的安全测试思路解析
Gemini Spark 将持久化智能体引入 Gemini App,Google Bug Hunters 发文说明针对这一新范式的安全测试方法与高影响力漏洞的关注重点。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA 用 Nemotron 构建自适应智能体网络安全系统
NVIDIA 基于 Nemotron 打造自适应智能体网络安全系统,目标是识别现有防线遗漏之处并将缺口转化为改进方向。该系统面向安全运营场景,强调突破既有告警、预设工作流和已知攻击行为的束缚,而非仅将智能体接入传统流程。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA OpenShell:为 AI 智能体添加运行时控制
NVIDIA 推出 OpenShell,为 AI 智能体提供运行时控制能力。智能体可被赋予目标、编写代码、调用工具并在新信息出现时持续工作,适用于调查软件故障、运行实验以及执行跨天或跨周的关键业务操作与研究。这类智能体需要访问工作区、计算资源、数据、凭证和外部服务。
- 动态Google Bug Hunters
Google 借助 AI 将 C 库 giflib 重写为 Rust 以缓解内存安全问题
Google 披露其用 AI 辅助将一个名为 giflib 的 C 库重写为 Rust,目的是缓解内存安全类漏洞。该工作属于其在依赖项层面规模化推进内存安全的尝试,博客同时给出了这次 AI 协助重写的实践路径。(共三句,含受影响对象名称与目标。)
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA 开放智能体安全平台:面向持续在硅基芯片内监测智能体的参考方案
NVIDIA 发布了开放智能体安全平台,作为持续在硬件层面对 AI 智能体进行监测的参考实现。该平台将互联网兴起带来的机遇与风险作类比,强调智能体时代同样需要在底层提供安全保障。目前公开的信息仅为其定位说明,尚未披露具体的监测机制与技术指标。
- 动态Goodfire Research
Goodfire 用 Evo 2 嵌入实现 420 万个遗传变异的可解释预测
Goodfire 与 Mayo Clinic 合作,基于基因组基础模型 Evo 2 的嵌入向量构建轻量分类器,对 839k 个 ClinVar 变异做致病性预测,整体 AUROC 达 0.997,优于现有方法。该方法覆盖编码与非编码区域,可泛化到留出数据,并借助可解释性工具生成机制性假设。团队通过 Evo Variant Effect Explorer(EVEE)公开全部 420 万个 ClinVar 变异的效果预测与假设解释,研究仍在同行评审中。
- 动态Transformer Circuits
Anthropic 开源注意力头可视化工具 HeadVis
Anthropic 可解释性团队发布交互式工具 HeadVis,用于研究大语言模型中的注意力头,并开源了前端代码与后端接口规范。工具通过注意力模式可视化、分布指标、低秩分量投影以及经 QK 和 OV 电路的 SAE 特征归因,帮助生成和检验关于注意力头功能的假设。作者用 Claude Haiku 3.5 做了四个案例:归纳头在特征基上表现为模糊归纳;此前研究的行宽头在完整分布上呈现年份、多 token 词和换行三种行为,PCA 显示 Q、K、O 激活可清晰聚类;答案选择头在更广分布上复用了同一套选择机制,虚拟权重分析提示它可能是单义的;同集合抑制头会抑制国家与其本国城市之间的注意力,在 185 句自造句子上有 98% 的情况成立。
- 论文arXiv
SKILLLITE:用小模型做证据引导的恶意 Agent Skill 审计
SKILLLITE 是一个证据引导的智能体框架,用紧凑、可本地部署的 LLM 检测 Agent Skill 中的恶意行为。研究指出小模型难以识别复杂 Skill 包中隐含的恶意行为,SKILLLITE 先提取安全相关行为并推断 Skill 的预期功能,再据此评估恶意性。
- 论文arXiv
Q-learning Penalized Transformer(QPT):面向安全离线强化学习的训练-推理一致框架
研究者提出 Q-learning Penalized Transformer(QPT),一种训练-推理一致的框架,将条件序列建模与约束感知的价值估计结合,用于安全离线强化学习。
- 论文arXiv:Agent 与 MCP 安全
研究:MCP 错误信息面向开发者,能力越强的 Agent 受损越大
研究统计 150 个常用 MCP 服务器中 3001 条错误信息,其中 949 条告诉调用方下一步怎么做,一半步骤依赖服务器看不到的调用方信息。
- 论文arXiv:Agent 与 MCP 安全
Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统
Tracekit 是一个开源、无依赖的审计系统,为每个 Agent 会话捕获人类意图、模型自述推理和实际执行动作三条通道,写入哈希链账本并交叉核对。它接入 Claude Code 生命周期事件、重建多 Agent 层级、在工具调用前做策略拦截,并支持其他 Agent 通过 SDK 或 HTTP API 上报事件。
- 动态Unit 42
Unit 42 用行为聚类识别云身份角色,覆盖 125 个云环境逾 4 万个身份
Unit 42 提出基于云审计日志的行为聚类模型,用 UMAP 与 HDBSCAN 将云身份映射为管理员、备份服务、安全工具、DevOps 等功能角色,数据来自 125 个云环境、逾 4 万个身份、为期两个月。
- 动态Unit 42
OperTraitor:Kubernetes Operator 如何背离你的安全态势
Unit 42 开源了 LLM 驱动的分析引擎 OperTraitor,它从本地 Operator 和 OperatorHub 目录读取原始 RBAC 配置,比对 Operator 文档功能与实际授予权限的差异,并给出 1–10 的风险评分。
- 动态Google Security
Google VRP 2025 年度回顾:15 周年,奖金超 1700 万美元
Google 漏洞奖励计划(VRP)2025 年迎来 15 周年,向全球 700 多名研究者发放超 1700 万美元奖金,创历史新高,较 2024 年增长逾 40%。
- 动态OpenAI Alignment Research
OpenAI 开源思维链可监控性评测数据集与参考代码
OpenAI 开源了其思维链可监控性研究中的大部分评测数据集、g-mean 2 指标计算代码,以及一种让干预式估计更抗噪声的交叉拟合过滤策略,代码托管在 GitHub 仓库 openai/monitorability-evals。
- 动态Failure-First
FORGE-plus:用冻结 LLM 监督者实现力预算约束的接触密集装配恢复
FORGE-plus 是一个双层机器人装配框架,由冻结的纯文本 LLM 担任“预算设定者”和“恢复选择者”,按物体材质、质量与几何设定力上限 Fmax,底层 60–120 Hz 控制器用 ForceClamp 将所有指令力饱和至该上限,并以 120 N 全局硬上限防止模型幻觉。
- 动态Trail of Bits
Lean 4.33.1 及更早版本存在字符串切片漏洞,可“证明”费马大定理
Lean 所有 4.33.1 及之前的稳定版本存在一个字符串切片漏洞,攻击者可借此制造矛盾并“证明”费马大定理。问题出在 String.Pos.Raw.extract:在超大位置提取一字节切片时,逻辑定义返回空字符串,而编译后的原生代码返回整个原字符串,两者不一致即可推出空串等于非空串。
- 动态Trail of Bits
Trail of Bits 称 1Password 的 AI 补丁基准具有误导性
Trail of Bits 质疑 1Password 的 FLAWED 漏洞补丁评测,认为样本选择、故意引导错误修法以及禁止编译测试等条件影响了头条结论。其复算在另一组实验条件下得到较高的阻断给定 exploit 比例,但明确指出阻断该测试不等于完整修复,两个比例不能直接比较。文章也讨论自动评分局限;Trail of Bits 与 OpenAI 合作开展补丁项目,存在相关利益关系。这里保留反驳方论点,不将其视为对原报告的独立裁定。
- 动态Can.ac
Snapcompact:把上下文窗口渲染成像素字体图像,成本降至三分之一
Snapcompact 提出一种本地压缩方案:上下文窗口填满后,将文本渲染为 6×10 像素字体位图并以图像形式回传,40k 字符约合 3,279 image tokens,输入价格降至约三分之一。
- 动态Trail of Bits
Trail of Bits 用 AI Agent 自建工具链审计 Miden zkVM
Trail of Bits 在审计 Miden 零知识虚拟机前,用六个月时间让 AI Agent 从零构建了 LSP 服务器、反编译器和静态分析引擎,并发现一个高危漏洞:mod_12289 过程中 prover 提供的余数未经验证,恶意 prover 可借此伪造 Falcon 签名并盗取账户资金。
- 动态Failure-First
受人类手术启发的机器人开颅框架:多模态融合与自适应轨迹调整
针对现有机器人开颅多为"开环"系统、无法应对术中配准误差与颅骨位移的问题,研究者提出一套融合多模态感知与自适应控制的框架,用双轮廓融合轨迹规划配合球头工具单级螺旋铣削。其 CMA-TCN-Transformer 网络融合力信号与铣削声音,再经自适应贝叶斯滤波抑制误触发,并在检测到穿透后原位修正辅助轨迹。牛肋与离体羊颅实验显示,闭环系统在进度 ξ≥0.9 时将进给速度降至 vsafe=1mm/s。