跳到正文
10月10日 · 周六

全部论文

找到 150 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.11932

    复旦团队测量 AI 搜索引用脆弱性:普通发帖可进入引用与答案文本

    测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答

    发表
    被测模型
    Grok、Doubao、ChatGPT 等 10 个

    摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。

    深度解读完整解读
  2. 防御arXiv 2610.11754

    仅凭输出审查无法验证什么:面向研究智能体的研究契约

    提出研究合同,把已批准选择绑定到执行证据并由检查器核验

    发表
    被测模型
    OpenAI gpt-5.6-sol、OpenAI gpt-5.6-terra、OpenAI gpt-5.6-luna 等 18 个
    摘要研究合同暴露四类输出单独建不立的关系。

    研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。

    深度解读完整解读
  3. 可解释性arXiv 2610.10865

    用路由稀疏自编码器解耦语音编码器中的语言学与副语言学信息

    提出路由 TopK SAE,把语音编码器稀疏码拆成语言与副语言通路

    发表
    被测模型
    SPEAR XLarge、WavLM Large
    摘要路由 SAE 在冻结 SPEAR 与 WavLM 上分开语言和副语言因子,探针与交换支持通路分工。

    TopK SAE 的稀疏码被分成语言通路与副语言通路,用来分开冻结语音编码器里同时存在的音素信息和说话人、情感、韵律。只重构不能得到作者选定的这一分解。语言通路由音素识别监督,副语言通路由说话人识别、情感分类和韵律预测监督,作用在对方通路上的梯度反转对抗用来压低交叉因子。

    深度解读完整解读
  4. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    被测模型
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  5. 防御arXiv 2610.08082

    POLAR:面向小型工具调用智能体的可逆性护栏框架

    提出 POLAR 本体门控,在执行前否决不可逆工具调用

    发表
    场景
    AI Agent
    被测模型
    qwen/qwen3-8b、meta-llama/llama-3.1-8b-instruct、nvidia/nemotron-nano-9b-v2 等 6 个
    摘要训练无关的事前可逆性门控,弱 airline 模型有收益,强模型与 retail 常回落。

    POLAR 是训练无关的事前门控,用类型化本体在工具调用执行前检查能否组成候选逆序列。

    深度解读完整解读
  6. 评测与基准arXiv 2610.07359

    论文实测 Agent 工具调用门控栈的失败相关性

    提出 nmult 并评测 Agent 动作门禁堆叠的错误相关性

    发表
    场景
    AI Agent
    被测模型
    AgentTrust runtime (174 rules)、GPT-5.5 (gpt55)、claude-haiku-4-5-20251001 等 7 个
    摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。

    深度解读完整解读
  7. 防御arXiv 2610.07258

    AMU:用派生血缘门控实现企业 AI Agent 列级访问控制

    提出 AMU 按推导图门控企业 Agent 共享记忆的列级访问

    发表
    场景
    AI Agent
    摘要在完整血缘下,AMU 按列权限放行缓存,并标出同名 KPI 冲突。

    AMU 用列级推导门控共享记忆,拦截经缓存流出的无权敏感列,并标出同名 KPI 的定义冲突。

    深度解读完整解读
  8. 评测与基准arXiv 2610.06339

    BabelFake:面向多语言音视频 DeepFake 检测的基准数据集

    构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器

    发表
    被测模型
    SpeechForensics、AVH-Align、(B)RAVEn
    摘要BabelFake 为五语同意采集基准。

    BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。

    深度解读完整解读
  9. 防御arXiv 2610.05826

    研究者提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    发表
    摘要用截止期限制未核验可见时长。

    这篇工作给持续摄入的 RAG 向量库一个失败关闭的临时可见性协议,把协议能限制的未核验暴露和依赖检测器的中毒暴露分开。

    深度解读完整解读
  10. 评测与基准arXiv 2610.05586

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别

    发表
    场景
    web agent
    被测模型
    GPT-5.6 Terra、GPT-5 Mini、GPT-4.1 Mini 等 10 个

    摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。

    深度解读完整解读
  11. 分析与理论arXiv 2610.07005

    研究审计 Qwen2-Audio 音频越狱 AdvWave-P 的频率与解码层归因

    遮挡审计 AdvWave-P 音频越狱的频带必要性与解码层关联

    发表
    被测模型
    Qwen2-Audio-7B-Instruct、LLaMA-Omni
    摘要AdvWave-P 的八频带排序与能量相关。

    这是对加性音频越狱 AdvWave-P 的频率与解码器深度审计,受害模型主要是 Qwen2-Audio-7B-Instruct,不提出新攻击。

    深度解读完整解读
  12. 分析与理论arXiv 2610.04860

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预

    发表
    被测模型
    LLaMA 3.1 8B Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-14B-Instruct
    摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。

    论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。

    深度解读完整解读