跳到正文
10月10日 · 周六

全部论文

找到 281 篇
筛选7

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.10865

    用路由稀疏自编码器解耦语音编码器中的语言学与副语言学信息

    提出路由 TopK SAE,把语音编码器稀疏码拆成语言与副语言通路

    发表
    被测模型
    SPEAR XLarge、WavLM Large
    摘要路由 SAE 在冻结 SPEAR 与 WavLM 上分开语言和副语言因子,探针与交换支持通路分工。

    TopK SAE 的稀疏码被分成语言通路与副语言通路,用来分开冻结语音编码器里同时存在的音素信息和说话人、情感、韵律。只重构不能得到作者选定的这一分解。语言通路由音素识别监督,副语言通路由说话人识别、情感分类和韵律预测监督,作用在对方通路上的梯度反转对抗用来压低交叉因子。

    深度解读完整解读
  2. 防御arXiv 2610.09793

    用时序逻辑监控工具 Agent

    提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链

    发表
    场景
    AI Agent
    攻击者
    黑盒
    摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。

    这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。

    深度解读完整解读
  3. 防御arXiv 2610.09703

    研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制

    提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱

    发表
    攻击者
    黑盒
    被测模型
    LLaVA-1.5-7B
    摘要剪枝去掉背景 token 后注意力塌向恶意前景。

    这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。

    深度解读完整解读
  4. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  5. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知

    发表
    被测模型
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  6. 防御arXiv 2610.09469

    Secure-CUA:约束计算机使用智能体中不可信内容的影响

    提出 Secure-CUA,用动作事务约束计算机使用智能体的不可信影响

    发表
    场景
    web agent
    被测模型
    Claude Opus 5、Gemini 3.8 Flash、GPT-5.6-Sol
    摘要Secure-CUA 用每步事务约束不可信影响,良性 TSR 接近 Vanilla-CUA。

    Secure-CUA 要限制图形界面里不可信内容对 CUA 决策和 GUI 执行的影响,同时保留合法任务所需的不可信信息。

    深度解读完整解读
  7. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作

    发表
    场景
    web agent
    被测模型
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  8. 评测与基准arXiv 2610.08902

    论文提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    发表
    被测模型
    Claude Fable 5、Claude Opus 5、GPT-5.6 Sol 等 10 个
    摘要作者用固定权重协议比较前沿模型把经验写成制品后的留出增益与习得效率。

    作者用 agent plasticity 衡量一件事:权重冻结时,智能体把经验写成可继承制品,再换成留出能力增益,这个转换有多省。

    深度解读完整解读
  9. 评测与基准arXiv 2610.08215

    Learn2Play Bench 发布:用规则陌生的文本游戏评测 LLM Agent 从经验中学习的能力

    用 Learn2Play Bench 评测 Agent 从经验中学习陌生规则

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 5.5、GPT-6 Astra、Claude Opus 5 等 11 个
    摘要用隐藏规则游戏把新学习与预训练知识分开,并比较模型、记忆方式和人类。

    Learn2Play Bench 用新设计的隐藏规则文本游戏,评测 LLM 智能体在不更新权重时从交互中学习的能力。

    深度解读完整解读
  10. 防御arXiv 2610.07774

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    AI 导读研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。

    发表
    被测模型
    Qwen3-VL-30B-A3B-Instruct、Kimi-VL-A3B-Instruct
    摘要读出而非操纵 router logits,可在不改模型的情况下降低两模型的组合式安全错误。

    作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。

    深度解读完整解读
  11. 防御arXiv 2610.07657

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击

    发表
    被测模型
    Qwen3-235B-A22B-Instruct-2507、gpt-oss-120b、Llama-4-Scout-17B-16E-Instruct 等 5 个
    摘要DEFER 把确定性检查放在 judge 之前。

    DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。

    深度解读完整解读