跳到正文
10月10日 · 周六

全部论文

找到 4 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.10613

    后验重加权框架解释并缓解多模态大模型上下文越狱

    用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御

    发表
    被测模型
    Qwen3-VL-2B、Qwen3-VL-4B、Qwen3-VL-8B 等 8 个
    摘要后验重加权解释上下文越狱的缩放,并支持风险门控的良性示例防御。

    Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。

    深度解读完整解读
  2. 防御arXiv 2605.08382

    SecureForge 通过提示词优化发现并减少 LLM 生成代码漏洞

    提出 SecureForge,在推理时优化系统提示以减少编码智能体的代码弱点

    发表
    被测模型
    Qwen 2.5 Coder 7B、Qwen 2.5 Coder 14B、Qwen3 30B-A3B 等 10 个
    摘要SecureForge 审计良性 CWE 失败并优化系统提示词。

    SecureForge是一条只用 API 和静态分析、在推理时加固编码模型的流水线。

    深度解读完整解读
已经到底了