跳到正文
10月9日 · 周五

Agent 安全 · 论文

找到 3 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 215 篇还没打标签,不在筛选结果里。

另有 215 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.04125

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    深度解读完整解读
  2. 可解释性arXiv 2609.35117

    工具调用改变大语言模型的拒答机制

    比较对话与工具中介通道的拒答内部机制

    发表
    测试
    Qwen3-8B、Qwen3-32B、Llama-3.1-8B 等 8 个
    摘要有害性跨通道仍可读,工具通道用更高阈值且更易被 GCG 与消融打破。

    作者在八个开源指令模型上研究:同一有害意图从对话改由工具交付时,拒答为何变弱,内部计算是否也变了。。

    深度解读完整解读
已经到底了