跳到正文
10月10日 · 周六

全部论文

找到 9 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.10992

    拆解 LLM 交互中的隐私-效用权衡:Veilmind-4B 意图驱动本地保护框架

    提出意图驱动本地框架 Veilmind,净化发往远程模型的提示词

    发表
    被测模型
    Veilmind-4B
    摘要本地模型按意图净化提示词,在 Uprise 上给出两个隐私-效用工作点。

    本地侧的意图驱动净化,用来降低用户提示词发往不受信任远程模型时的敏感属性暴露。

    深度解读完整解读
  2. 防御arXiv 2609.02786

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略

    发表
    场景
    AI Agent
    被测模型
    Qwen3.5-4B、Qwen3-4B-Instruct-2507、Qwen3.5-1.7B 等 4 个
    摘要SafeEvolve 用轨迹证据协同更新安全 harness 和策略,在两个 4B 模型的智能体安全基准上改变安全与效用。

    SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。

    深度解读完整解读
  3. 防御arXiv 2609.29647

    AgentKernel:面向 Agent 的可信原生操作系统内核

    提出 AgentKernel,用四支柱强制中介 Agent 的输入、工具与记忆

    发表
    场景
    AI Agent
    摘要AgentKernel 是四支柱智能体 OS 设计,安全论证未附带实测数字。

    AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。

    深度解读完整解读
  4. 防御arXiv 2312.06632

    用智能体控制化学科学中的 AI 风险:SciGuard 护栏与 SciMT 基准

    提出 SciGuard 外部护栏与 SciMT 基准,控制化学科学 AI 误用

    发表
    被测模型
    SciGuard (GPT-4)、SciGuard (Gemini)、SciGuard (Mixtral) 等 5 个
    摘要SciGuard 以外部智能体控制化学 AI 误用。

    这篇工作把化学科学 AI 的误用控制做成外部智能体,而不是改模型权重。作者担心合成规划、毒性预测和科学语言模型被用来获取有害物质信息、规避监管或传播危险知识,同时合法工业用途又不能靠一律拒绝来处理。SciGuard 由 LLM 担任中介,把原则和指南放进短期记忆,把分子库、危害库、法规和交互历史放进可检索的长期记忆,再按 Chain of Thought 调用 Chemprop、LocalRetro 等工具,或用 RAG 补法规片段,最后回答、追问或拒绝。

    深度解读完整解读
已经到底了