跳到正文
10月9日 · 周五

全部论文

找到 22 篇

另有 669 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    测试
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  2. 分析与理论arXiv 2610.06191

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    分析工具型 Agent 判定检索无用却不停止的原因

    发表
    场景
    AI Agent
    测试
    Qwen2.5-7B、Llama-3.1-8B、Qwen3-8B 等 7 个
    摘要论文揭示智能体判定工具失效却无法转化为停止行动,证实通过框架规则强制整合判定可提升表现。

    本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。

    深度解读完整解读
  3. 评测与基准arXiv 2610.03448

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重评 Agent 提示注入检测器,检验基准分数能否预测部署表现

    发表
    场景
    AI Agent
    测试
    Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    深度解读完整解读
  4. 评测与基准arXiv 2608.18066

    Salesforce AI Research 重测自改进 Agent

    重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳

    发表
    测试
    GPT-5-mini、Gemini-2.5-Pro、GPT-OSS-120B 等 4 个
    摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。

    这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。

    深度解读完整解读
  5. FairMedAgent:临床 LLM 智能体公平性审计中的随机噪声下限

    用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限

    发表
    测试
    claude-haiku-4-5、claude-sonnet-5、llama3.1:8b-instruct 等 7 个
    摘要先测同一输入下的动作不一致率,再用它解读人口学翻转率。

    FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。

    深度解读完整解读
  6. 风险行为arXiv 2609.35928

    论文发现暴露模型身份标签会削弱多智能体 LLM 合作

    测量公开模型家族标签引发的多智能体派系化与合作下降

    发表
    测试
    Gemma (gemma-4-26B-A4B-it)、GPT-OSS (gpt-oss-20b)、Nemotron (NVIDIA-Nemotron-3-Nano-30B-A3B-BF16) 等 6 个
    摘要可见身份标签让异构 LLM 群体按标签结派,共识更慢、更贵,去掉标签后该行为消失。

    Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。

    深度解读完整解读
  7. 分析与理论arXiv 2609.40295

    一个 AI token 值多少?研究者为野生 AI 生成网页文本提出新缩放定律

    提出预训练缩放律,估计野生 AI 网页文本相当于多少人类 token

    发表
    测试
    nanochat 19.9M、35.8M、86.2M 等 7 个
    摘要wild AI 文本对数据不足的模型先降损失,对高人类预算几乎立刻升损失。

    作者测量未标注的 wild AI 网页文本对预训练的影响,并提出一个能让 AI token 价值变号的缩放律。

    深度解读完整解读
  8. 评测与基准arXiv 2609.15017

    PIDS-Bench:在过度防御、混淆与分布偏移下评测提示注入检测器

    提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现

    发表
    测试
    TF-IDF + logistic regression、DistilBERT、DeBERTa-v3-FT 等 8 个
    摘要PIDS-Bench 显示高分布内 F1 仍会过度拦截外部来源的安全相关良性输入。

    PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。

    深度解读完整解读
  9. 评测与基准arXiv 2609.19140

    AgentLSD:在对抗性任务污染下评测 AI 安全 Agent

    用 AgentLSD 评测安全 Agent 在对抗任务污染下的解题与开销

    发表
    测试
    Gemma-4 31B、DeepSeek-V4 Flash、GPT-OSS 120B 等 6 个
    摘要AgentLSD 用配对 web CTF 表明,欺骗性环境证据会改变安全智能体的解题率与工作量。

    AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。

    深度解读完整解读
  10. 攻击arXiv 2609.27124

    Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习

    提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复

    发表
    攻击者
    灰盒
    测试
    CNN(MNIST:2 Conv + 3 FC)、CNN(Fashion-MNIST:6 Conv + 1 FC)、ResNet18(CIFAR-10)
    摘要Fed-ADR 用 gray-box 编排攻击绕过多种聚合防御,再用 Hessian 一致性检测和窗口内恢复把准确率拉回。

    Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。

    深度解读完整解读
  11. 其他arXiv 2609.39982

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    提出 Mid-Harness,在执行前验证并选择终端智能体的候选动作

    发表
    测试
    TMAX-9B、TMAX-4B、TMAX-27B 等 8 个
    摘要Mid-Harness 在执行前选择候选动作。

    Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。

    深度解读完整解读
  12. 评测与基准arXiv 2609.40111

    Agent Error Dataset 发布 5 万条错误诊断配对,用于失败分析与错误感知后训练

    构建 AED,把智能体自然失败转为诊断与动作修复训练数据

    发表
    场景
    AI Agent
    测试
    Qwen3-8B、GPT-6 Astra、Claude Sonnet 5 等 8 个
    摘要AED 把自然失败做成诊断与修正数据。

    AED是一个面向文本智能体的错误–诊断集合,用来把失败轨迹转成可分析、可训练的诊断与修正,而不是只保留最终奖励。

    深度解读完整解读
  13. 攻击arXiv 2609.01495

    去中心化联邦学习中的拜占庭节点放置优化

    提出 BPI 选点算法,增强去中心化联邦学习中的模型与数据投毒

    发表
    摘要BPI 用有限轮 gossip 暴露选拜占庭集合。

    作者把 DFL 中“破坏哪 m 个节点”写成攻击者在固定预算下的优化问题,并用 BPI 近似有限轮内诚实节点受到的拜占庭暴露。

    深度解读完整解读
  14. 防御arXiv 2609.34857

    CREDO:用可微读出替代文本采样校准推理模型置信度

    提出 CREDO,用保留 token 对的可微读出校准推理模型置信度

    发表
    测试
    Qwen3-8B、Qwen3-1.7B、Qwen3-4B
    摘要CREDO 用可微两 token 读出替代口头置信,在数学和代码上同时拉高准确率与校准。

    CREDO 把 RLVR 里的置信从“采样一个数字”改成“读一对保留 token 的相对概率”,并用可微回归和差异加权同时拉准确率与校准。。

    深度解读完整解读
  15. 攻击arXiv 2609.22711

    UBA-ORL:针对离线强化学习的遗忘激活后门攻击

    提出 UBA-ORL,借助 BD 与 CM 样本让离线强化学习后门在轨迹删除后激活

    发表
    测试
    TD3+BC、BCQ、IQL
    摘要UBA-ORL 用竞争的 BD/CM 样本,使离线 RL 后门在删除伪装轨迹后激活。

    UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。

    深度解读完整解读
  16. 分析与理论arXiv 2609.32288

    预训练数据投毒的可解理论:依赖极限顺序的缩放指数

    证明预训练投毒的清洁超额风险指数随极限顺序变化

    发表
    测试
    OLMo-style models
    摘要投毒清洁超额风险的幂指数取决于先固定宽高比还是先取充足数据极限。

    可解的预训练数据投毒理论:清洁超额风险的缩放指数随极限顺序改变。。

    深度解读完整解读
  17. 攻击arXiv 2609.28585

    论文提出持久计费状态概念,揭示工具调用 LLM Agent 的拒绝钱包攻击与防御

    提出工具调用 Agent 的拒绝钱包攻击及主机侧计费约束

    发表
    场景
    AI Agent
    测试
    GPT-4o、GPT-4o-mini、Mistral-Large 等 9 个
    摘要已准入工具返回的跨轮保留会重复计费。

    这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。

    深度解读完整解读
  18. 评测与基准arXiv 2609.33658

    AgentBound:面向工具型 LLM Agent 安全的四路反事实评测框架

    提出四向反事实评测,测量工具 Agent 对授权与表面风险的行动边界

    发表
    场景
    AI Agent
    测试
    GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash 等 15 个
    摘要四向反事实基准把过度拒绝和未授权遵从拆开,Thought 校正在十个配置上提高已授权完成。

    AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。

    深度解读完整解读