跳到正文
10月10日 · 周六

全部论文

找到 4 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 201 篇还没打标签,不在筛选结果里。

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.06576

    研究:智能体欺骗行为在外部显现前已可从内部表征预测

    提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗

    发表
    场景
    AI Agent
    被测模型
    Qwen3-14B

    摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。

    深度解读完整解读
  2. 可解释性arXiv 2610.06064

    TrustMI:通过模型激活因果控制助手对用户的信任

    提出 TrustMI,用激活转向因果调控助手对用户主张的信任

    发表
    场景
    AI Agent
    被测模型
    Qwen3.5-9B、Qwen3.5-27B、Llama-3.1-8B-Instruct 等 6 个
    摘要作者用 BiPO 转向调控助手对用户的依赖,并称该效应迁移到智能体安全任务。

    TrustMI 研究助手对用户的信任能否沿激活中的线性方向被因果调控,以及这种调控会不会改变安全相关的智能体行为。

    深度解读完整解读
  3. 可解释性arXiv 2609.36138

    SAKIKO:对工具调用 LLM 内部干预的机制审计框架

    提出 SAKIKO,审计工具调用模型的激活干预是否构成修复

    发表
    场景
    AI Agent
    被测模型
    Phi-3.5-mini、Qwen2.5-7B、Llama-3.1-8B 等 8 个
    摘要SAKIKO 用目的地、保持和预注册不确定性裁定内部转向是否算修复。

    SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。

    深度解读完整解读
已经到底了