跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 12 篇
筛选

模型自身风险

系统组件

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 383 篇还没打标签,不在筛选结果里。

另有 285 篇还没有研究类型,暂不在这些分类里。

  1. 可解释性arXiv:2610.04125 ·

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    模型与 API测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个模型层
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    完整解读
  2. 分析/可解释性arXiv:2609.38411 ·

    研究提出自主 Agent 失控的竞争风险系统化框架

    AI 导读作者提出一个统一框架,把 Agent 的每次尝试归为批准完成、安全停止、越界逃逸或继续四类结果,并将其形式化为离散时间竞争风险模型,推导出重试预算内的逃逸概率、模型条件下的安全预算上限,以及从执行日志估计这些量的条件。

    摘要竞争风险框架把完成、停止与逃逸放在同一预算上,审计显示现有记录不足以估计该过程。

    完整解读
  3. 分析/可解释性arXiv:2609.38723 ·

    面向智能体的高效 HPC 系统:挑战与机遇

    AI 导读编码智能体已成为 HPC 系统的真实用户,但现有 HPC 抽象、接口与策略仍为人类工作流设计。

    摘要FASRC 测量说明编码智能体改变 HPC 使用方式,作者据此提出四层协同设计议程。

    这是一篇对生产 HPC 上编码智能体的测量与系统议程论文,不是攻击实现或防御评测。。

    完整解读
  4. 分析/可解释性arXiv:2609.27234 ·

    CELLAUDIT:审计 AI 智能体发现细胞模型中的输入使用声明

    AI 导读CELLAUDIT 通过审计输入能否进入所引计算、拟合预测是否依赖该输入、以及该依赖是否改善对观测响应的预测,来检验 AI 智能体发现细胞模型中的输入使用声明。

    测试CellScientist、AIDE、CellForge 等 8 个
    摘要CellAudit 把输入使用声明从源码追到拟合贡献,并说明高分不必等于使用了扰动。

    CellAudit 为智能体发现的细胞响应模型增加一层输入使用证伪:源码是否消费注册输入、拟合预测是否依赖它、该依赖是否改善对观测响应的预测。

    完整解读
  5. 分析/可解释性arXiv:2609.34686 ·

    研究揭示工具智能体中越狱上下文残留导致的安全路由分化

    作者用配对续写与层间激活修补发现,越狱后安全反馈在工具智能体上分成三条路由,且晚层干预特征可在留一父任务上预测这些结局。

    测试Qwen3-14B、Qwen3.5-9B、Qwen3.5-27B 等 8 个
    摘要越狱后的同一安全反馈在八个工具智能体上分成三条路由,因果集中在最后几层并可作预测基线。

    这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。

    完整解读
  6. 分析/可解释性arXiv:2609.36138 ·

    SAKIKO:对工具调用 LLM 内部干预的机制审计框架

    AI 导读论文提出 SAKIKO 审计框架,用于检验对工具调用 LLM 内部激活的干预是否真正构成表征修复。该框架包含方向性错误发现、路由条件干预、按目标结果验证和前瞻性冻结的统计许可四个环节。

    测试Phi-3.5-mini、Qwen2.5-7B、Llama-3.1-8B 等 8 个
    摘要SAKIKO 用目的地、保持和预注册不确定性裁定内部转向是否算修复。

    SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。

    完整解读
  7. 分析/可解释性arXiv:2609.35117 ·

    工具调用改变大语言模型的拒答机制

    作者比较对话与工具中介两种通道下的拒答,发现有害性仍可解码,但工具通道拒答阈值更高且更易被扰动打破。

    测试Qwen3-8B、Qwen3-32B、Llama-3.1-8B 等 8 个
    摘要有害性跨通道仍可读,工具通道用更高阈值且更易被 GCG 与消融打破。

    作者在八个开源指令模型上研究:同一有害意图从对话改由工具交付时,拒答为何变弱,内部计算是否也变了。。

    完整解读
已经到底了