跳到正文
10月9日 · 周五

Agent 安全 · 论文

找到 14 篇

另有 199 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09667

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    揭示推理模型用标识符规则替代随机抽样,使审计可被预测

    发表
    测试
    GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个

    摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。

    深度解读完整解读
  2. 可解释性arXiv 2610.04125

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    深度解读完整解读
  3. 其他arXiv 2610.03093

    LS-AR 双通道架构:文本目标丢弃可抵御提示注入但引入潜在向量攻击面

    提出 LS-AR,用潜向量经 FiLM 调节自回归解码以保持宏观目标

    发表
    测试
    Baseline (AR GPT-2)、LS-AR (Static)、LS-AR (Dynamic) 等 6 个
    摘要用潜通道把宏观目标从 token 流拆出,并在合成检索与规划上比较静态、动态两种调节。

    LS-AR 给因果解码器加一条不占窗口的连续目标通道,用来处理长程生成里宏观指令被挤出上下文或被注意力稀释的问题。

    深度解读完整解读
  4. 评测与基准arXiv 2610.02142

    关键词式评测会误判小模型工具调用能力,论文提出廉价诊断阶梯

    提出诊断阶梯,揭示关键词工具调用评测的假阳性

    发表
    测试
    VectraYX-600M、VectraYX-1B
    摘要宽松 B4 把不会调用的 1B 记成会调用。

    作者记录 VectraYX 系列里一次工具使用评测的假阳性,并用一条廉价、与 harness 无关的诊断阶梯把它追到缺失的首 token prior,再按这一诊断修复 VectraYX-1B。

    深度解读完整解读
  5. 评测与基准arXiv 2609.39473

    FAME:用反事实推理评测自主智能体的虚假记忆

    提出 FAME,用反事实概念漂移评测智能体虚假记忆

    发表
    测试
    Llama-3B
    摘要FAME 用反事实引起的隐状态概念漂移,在出答案前区分忠实记忆与虚假记忆。

    FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。

    深度解读完整解读
  6. 评测与基准arXiv 2609.35408

    研究揭示 LLM 交付物修订痕迹导致的无意泄露,并提出 RevLeakBench 基准

    提出 RevLeakBench 测量交付物修订痕迹造成的无意泄露

    发表
    场景
    AI Agent
    测试
    GPT-5.6、GPT-5.5、DeepSeek-V4-Pro 等 6 个
    摘要修订痕迹让撤回项重新进入交付物。

    修订痕迹指模型按要求删掉或换掉一项后,又在交代这次修改时把它写进给第三方的交付物。

    深度解读完整解读
  7. 风险行为arXiv 2609.35291

    窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型

    发现无显式危害的窄域图文微调可诱发涌现失准

    发表
    测试
    GPT-4o、GPT-4.1、Gemini 2.5 等 15 个
    摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。

    论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。

    深度解读完整解读
  8. 可解释性arXiv 2609.36138

    SAKIKO:对工具调用 LLM 内部干预的机制审计框架

    提出 SAKIKO 框架,审计工具调用 LLM 的定向激活干预是否构成修复

    发表
    场景
    AI Agent
    测试
    Phi-3.5-mini、Qwen2.5-7B、Llama-3.1-8B 等 8 个
    摘要SAKIKO 用目的地、保持和预注册不确定性裁定内部转向是否算修复。

    SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。

    深度解读完整解读
  9. 可解释性arXiv 2609.35117

    工具调用改变大语言模型的拒答机制

    比较对话与工具中介通道的拒答内部机制

    发表
    测试
    Qwen3-8B、Qwen3-32B、Llama-3.1-8B 等 8 个
    摘要有害性跨通道仍可读,工具通道用更高阈值且更易被 GCG 与消融打破。

    作者在八个开源指令模型上研究:同一有害意图从对话改由工具交付时,拒答为何变弱,内部计算是否也变了。。

    深度解读完整解读
已经到底了