跳到正文
10月9日 · 周五

阿里巴巴 · Qwen · 论文

找到 9 篇

另有 16 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.25776

    EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播

    提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能

    发表
    测试
    GPT-OSS-120B、Devstral-Small-2、Gemma-4-31B-IT 等 7 个

    摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。

    深度解读完整解读
  2. 评测与基准arXiv 2609.32547

    研究者提出预算受限的 LLM 重复评测框架,优先深挖隐藏失败

    提出预算化发现框架,优先深评更可能隐藏失败的安全提示词

    发表
    测试
    GPT-4o-mini、openai/gpt-4o-mini、Qwen 2.5 7B 等 6 个
    摘要浅层零失败的提示词仍可按潜在失败倾向排序,从而把有限深评预算投向更可能暴露隐藏失败之处。

    作者把 LLM 可靠性评测写成预算约束下的隐藏失败发现:每条提示词有未知的逐次失败概率,浅层少量采样中的零失败并不等于该概率为零。

    深度解读完整解读
  3. 可解释性arXiv 2610.01821

    研究者提出非线性概念流形发现与对齐方法,用于分析大语言模型内部表示

    提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构

    发表
    测试
    GPT-2、Llama-3.1-8B-Instruct、Qwen3-4B 等 9 个
    摘要NLMCD-NLP 用 CBA 比较非线性概念,层块、语言共享和微调漂移都随模型与阶段而变。

    NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。

    深度解读完整解读
  4. 防御arXiv 2610.00850

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体

    发表
    测试
    GPT 5.6 Sol、Qwen3.5-4B、Muse Spark 1.3 等 11 个
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    深度解读完整解读
  5. 防御arXiv 2608.13304

    WIFA:按意图分组监督缓解包装式越狱与过度拒答

    提出 WIFA 意图组监督微调,缓解包装式越狱与过度拒答

    发表
    测试
    GPT-4o、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等 4 个
    摘要WIFA 用匹配意图组做数据层,WIFA-Boost 偏高安全,A-GCRT 在 Qwen 上把过拒降到基座以下。

    WIFA 是一种自动意图组数据构造,用来让安全微调拒绝有害意图而不是拒绝表面包装。WIFA-Boost 与 A-GCRT 在同一数据层上选取不同的安全–过拒工作点。

    深度解读完整解读
  6. 防御arXiv 2609.34970

    研究揭示 LLM 涌现失准的机制并提出参数空间缓解框架

    提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去

    发表
    测试
    GPT-OSS-20B、Qwen2.5-3B-IT、Qwen2.5-7B-IT 等 8 个
    摘要窄域 LoRA 会留下可测的有害子空间。

    See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。

    深度解读完整解读
  7. 分析与理论arXiv 2608.27340

    研究:评测感知分能力与安全两种框架,能力框架更易预测合规

    把口头评测感知分成能力与安全框架并检验对服从的预测

    发表
    测试
    GPT-5-mini、Qwen3-32B、OLMo-3-32B-Think
    摘要能力型与安全型口头 eval-awareness 对服从的符号相反,聚合抑制率因此不能代表安全相关成分。

    作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。

    深度解读完整解读
已经到底了