跳到正文
10月9日 · 周五

全部论文

找到 32 篇

另有 527 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.11932

    复旦团队测量 AI 搜索引用脆弱性:普通发帖可进入引用与答案文本

    测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答

    发表
    被测模型
    Grok、Doubao、ChatGPT 等 10 个

    摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。

    深度解读完整解读
  2. 防御arXiv 2610.05870

    MBZUAI 提出可校准的真实图像认证方法

    提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动

    发表
    攻击者
    白盒

    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    深度解读完整解读
  3. 防御arXiv 2610.05826

    研究者提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    发表
    摘要用截止期限制未核验可见时长。

    这篇工作给持续摄入的 RAG 向量库一个失败关闭的临时可见性协议,把协议能限制的未核验暴露和依赖检测器的中毒暴露分开。

    深度解读完整解读
  4. 分析与理论arXiv 2610.04860

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预

    发表
    被测模型
    LLaMA 3.1 8B Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-14B-Instruct
    摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。

    论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。

    深度解读完整解读
  5. 评测与基准arXiv 2609.39027

    从 RobustReview 基准到 SciCore:AI 审稿人的修辞鲁棒性评测

    构建 RobustReview 评测 AI 审稿修辞鲁棒性,并提出 SciCore 双分支评审

    发表
    被测模型
    GPT-5.5、GPT-5-mini、Claude Sonnet 5 等 14 个
    摘要修辞稳健性要求改写稳定且能区分论文。

    修辞稳健性被作者定为可信 AI 评审的一项独立要求:同一已报告科学内容换措辞后,科学判断应稳定,同时不同论文之间的区分不能塌掉。。

    深度解读完整解读
  6. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性

    发表
    被测模型
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  7. 评测与基准arXiv 2609.31342

    研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案

    评测 RAG 中过期文档推翻模型原本正确回答的现象

    发表
    被测模型
    GPT-4o、GPT-4.1、Claude-Opus-4.5 等 13 个
    摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。

    这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。

    深度解读完整解读
  8. 攻击arXiv 2609.19722

    ALIBI:向二进制注入虚假安全叙事可让 LLM 恶意软件分析器误判

    提出 ALIBI,向恶意二进制注入不执行掩护叙事使分析器误判为良性

    发表
    攻击者
    黑盒
    被测模型
    Gemini 2.5 Pro、GPT-5.5 Pro、Claude Opus 4.7
    摘要ALIBI 用二进制内的掩护叙事重释可疑静态证据,Gemini 上翻转多,另两模型主要为降级。

    ALIBI 是针对 LLM 恶意软件分诊的语义掩护叙事攻击:不覆盖系统指令,而把仍可见的可疑静态证据重释成良性安全产品的预期行为。

    深度解读完整解读
  9. 攻击arXiv 2609.17817

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码

    发表
    被测模型
    Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 5 个

    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。

    深度解读完整解读
  10. 评测与基准arXiv 2609.15017

    PIDS-Bench:在过度防御、混淆与分布偏移下评测提示注入检测器

    提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现

    发表
    被测模型
    TF-IDF + logistic regression、DistilBERT、DeBERTa-v3-FT 等 7 个
    摘要PIDS-Bench 显示高分布内 F1 仍会过度拦截外部来源的安全相关良性输入。

    PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。

    深度解读完整解读
  11. 防御arXiv 2609.11085

    超越求解器判定:面向自动形式化的生成式奖励模型

    提出 GenV,检测求解器判定无法区分的不忠实形式化

    发表
    被测模型
    GenV+HN、GenV、27B LM (LoRA) 等 13 个
    摘要GenV+HN 用离线 Z3 等价标签训练无参考 Yes/No 分数,用来标记 VPU 并分配测试时计算。

    GenV+HN 针对神经符号翻译之后、求解器证书之前的对应失败:编码可以与指定参考共享求解器判定,同时并不等价。

    深度解读完整解读
  12. 防御arXiv 2609.08394

    Windows 恶意软件检测器作为复合 AI 系统:准确率、效率与对抗鲁棒性的权衡

    提出 OBELISK 三级流水线,权衡恶意软件检测的准确率、开销与鲁棒性

    发表
    攻击者
    白盒、黑盒
    被测模型
    GBDT-ALL、GBDT-YARA、NEBULA-ALL 等 4 个
    摘要三级过滤以不大的检测损失换速度,同一机制扩大攻击面,部署应按约束选配置。

    OBELISK 把 Windows PE 恶意软件检测做成 YARA、EMBER-GBDT 与 Nebula 的顺序流水线,用来同时看检出、计算开销和对抗鲁棒性。

    深度解读完整解读
  13. 可解释性arXiv 2609.08173

    基于 SAE 引导的关键路径识别(KPI)解决知识冲突

    提出 KPI,用入度定位跨层关键路径并做 SAE 转向以解决知识冲突

    发表
    被测模型
    Llama-3-8B、Llama-3.1-8B、Gemma-2-9B
    摘要KPI 以入度关键路径替代大批 SAE 特征转向,在冲突 RAG 上提高忠实并减轻副作用。

    KPI 针对知识冲突 RAG 中的 SAE 转向:相关性批量改特征会带入冗余,少量因果上关键的特征即可完成转向。

    深度解读完整解读
  14. 超越最终决策:面向透明 AI 辅助同行评审的流程中心基准

    提出过程中心基准,检验 AI 辅助评审终审是否被中间证据支撑

    发表
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个
    摘要过程基准显示人工对齐变量更有决策价值,模型中间文本并未稳定支撑终审。

    该基准用来检查 AI 辅助同行评审的中间证据是否支撑最终决策,而不是只看终审对错。。

    深度解读完整解读