跳到正文
10月10日 · 周六

全部论文

找到 3 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 427 篇还没打标签,不在筛选结果里。

另有 427 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.07935

    SIGMA:让模型依据 Model Spec 自我改进安全对齐

    提出 SIGMA,让模型依据 Model Spec 自造对齐数据并改进安全对齐

    发表
    场景
    AI Agent
    被测模型
    Qwen3.6-27B
    摘要SIGMA 用 Model Spec 自造监督,单轮训练可迁到多项智能体安全指标。

    SIGMA 让 Qwen3.6-27B 只凭 Model Spec 和高层领域,自己生产对齐任务、评分细则和奖励。

    深度解读完整解读
  2. 攻击arXiv 2609.14060

    AgentQ:针对 LLM Agent 的量化条件后门攻击

    提出量化条件后门 AGENTQ,使智能体仅在量化后触发恶意工具调用

    发表
    场景
    AI Agent
    被测模型
    Qwen3.5-2B、Qwen3.5-4B、Qwen3.5-9B 等 6 个

    摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。

    深度解读完整解读
  3. 攻击arXiv 2609.07051

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    提出 TrojanWorld,用物理触发器对世界模型智能体植入想象引导后门

    发表
    被测模型
    TD-MPC2、DreamerV3、R2-Dreamer

    摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。

    深度解读完整解读
已经到底了