跳到正文
10月9日 · 周五

全部论文

找到 33 篇

另有 630 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    发表
    测试
    Phi-3-Vision-4B、LLaVA-v1.5-13B、LLaVA-v1.6-34B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  2. 防御arXiv 2610.03055

    HackTrace:用生成状态监督检测代码生成中的奖励作弊

    提出 HACKTRACE,用生成期激活检测代码智能体的奖励作弊

    发表
    测试
    CodeBERT、Qwen3-8B、Llama-3.1-8B-Instruct 等 4 个

    摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。

    深度解读完整解读
  3. 风险行为arXiv 2609.33220

    斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定

    度量强化学习后失败披露的跨运行不稳定性,并提出失败条件参考锚定

    发表
    测试
    Phi-4、Qwen2.5-1.5B、Qwen2.5-7B 等 11 个

    摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。

    深度解读完整解读
  4. 攻击arXiv 2607.12340

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持

    发表
    测试
    Nemotron-Cascade-2 30B、GLM-4.5-Air、GPT-5.4-mini 等 10 个
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    深度解读完整解读
  5. SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    提出 SkillSafe-Bench,评测技能合并模型的自适应越狱鲁棒性

    发表
    测试
    Phi-4-mini、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等 6 个
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    深度解读完整解读
  6. 可解释性arXiv 2608.21766

    研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关

    用探针与激活导向分析语言模型的评测意识表征及言语化

    发表
    测试
    Nemotron3-49B、Qwen3-8B、Qwen3-32B 等 14 个

    摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。

    深度解读完整解读
  7. 防御arXiv 2609.15886

    用学习到的新造词进行接种式 midtraining

    提出 Inoculation Midtraining,用新造词语境约束不安全行为泛化

    发表
    测试
    NVIDIA Nemotron 3 Super 120B Base、Nemotron 3 30B、Nemotron 3 550B
    摘要用 midtraining 给新 token 写入隔离语境,可在 120B 上选择性降低错位,但弱于接种提示且边界会漏。

    Inoculation Midtraining 试图在后训练之前,用一个开发者可控的新 token 把“允许错位”写成一条可开关的语境,使混合数据里的不安全成分留在该语境内。

    深度解读完整解读
  8. 防御arXiv 2610.00883

    DeBERTa-ConPara:面向部署的 AI 生成文本检测,推理端 Unicode 归一化提升对抗鲁棒性

    提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本

    发表
    测试
    microsoft/deberta-v3-large、deberta-v3-base、bert-large-cased 等 14 个
    摘要推理时归一化消除两类 Unicode 攻击,训练时归一化则会删掉对抗监督。

    DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。

    深度解读完整解读
  9. 防御arXiv 2610.01800

    LineupRL:基于描述与时序配对识别的可验证强化学习时间序列描述方法

    提出 LineupRL,用描述到序列识别作可验证奖励训练时序描述模型

    发表
    测试
    Phi-3.5-mini、Phi-4-14B、DeBERTa 等 15 个
    摘要LineupRL 用统计近邻上的序列识别做可验证奖励,3B 描述器超过 SFT、两种 RL 奖励和 72B 教师。

    LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。

    深度解读完整解读
  10. 防御arXiv 2610.00850

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体

    发表
    测试
    Nemotron 3.5、Qwen3.5-4B、Muse Spark 1.3 等 11 个
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    深度解读完整解读
  11. 风险行为arXiv 2609.39838

    研究:模型易学会隐写传信,隐写推理则难得多

    比较隐写推理与隐写传信、编码推理的可学性

    发表
    测试
    Nemotron-3-Super-120B、GPT-5.5、Claude Sonnet 5 等 14 个
    摘要隐写推理比传信和编码推理更难学。

    Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。

    深度解读完整解读
  12. 防御arXiv 2609.01046

    HiveTraceGuard-Pro:面向提示注入、越狱与对抗混淆的紧凑生成式护栏

    提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆

    发表
    测试
    Llama-3.1-Nemotron-Safety-Guard-8B-v3、Nemotron-3.5-Content-Safety、HiveTraceGuard-Pro (0.6B) 等 15 个
    摘要0.6B 俄英护栏在自建俄语干净集和 PI-RU 上得分最高,聚合 key 居第三,过阻断和回复精度仍是作者标出的短板。

    HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。

    深度解读完整解读
  13. 评测与基准arXiv 2609.36931

    研究发现系统提示中隐藏日期影响 LLM 评测结果

    测量系统提示中隐藏日期对评测分数与排名的影响

    发表
    测试
    Phi-4 (14B)、Llama 3.1 Instruct (8B)、Llama 3.1 Instruct (70B) 等 10 个
    摘要只改隐藏日期就足以改变分数和排名。

    这篇工作量化一个评测协议问题:系统提示词里用户看不见、且逐日变化的当前日期,会不会单独改变 LLM 分数。

    深度解读完整解读
  14. 其他arXiv 2609.39982

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    提出 Mid-Harness,在执行前验证并选择终端智能体的候选动作

    发表
    测试
    Nemotron3.5 Lightning、Nemotron3 Ultra、TMAX-9B 等 8 个
    摘要Mid-Harness 在执行前选择候选动作。

    Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。

    深度解读完整解读