跳到正文
10月10日 · 周六

全部论文

找到 8 篇
筛选7
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 232 篇还没打标签,不在筛选结果里。

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.06576

    研究:智能体欺骗行为在外部显现前已可从内部表征预测

    提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗

    发表
    场景
    AI Agent
    被测模型
    Qwen3-14B

    摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。

    深度解读完整解读
  2. 防御arXiv 2610.04412

    论文研究 LLM 数字孪生参与增强民主时的提示注入脆弱性

    提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位

    发表
    被测模型
    LLaMA-2 7B、LLaMA-3 8B、GPT 3.5 Turbo 等 14 个
    摘要三章依次做个体偏好预测、政党知识图谱审议,以及共识生成对提示注入的脆弱性与一条防御流程。

    这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。

    深度解读完整解读
  3. 攻击arXiv 2609.30383

    研究者提出技能级联攻击

    提出技能级联攻击,把有害目标拆散到多个技能里绕过单技能扫描

    发表
    场景
    AI Agent
    被测模型
    GPT-5.4、GPT-5.4 Mini、Claude Opus 4.6 等 11 个

    摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。

    深度解读完整解读
  4. 攻击arXiv 2609.01023

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链

    发表
    被测模型
    Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个

    摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。

    深度解读完整解读
已经到底了