跳到正文
10月9日 · 周五

全部论文

找到 10 篇

另有 677 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2609.23640

    人类对齐的模型是人类行为的模型吗?偏好对齐中的图灵测试差距

    形式化 Turing-test gap,并检验偏好对齐是否偏离人类行为

    发表
    测试
    DeBERTa-v3-large、Qwen2.5-7B-Instruct、Llama-3-8B-Instruct
    摘要偏好对齐不保证更像人。

    Yuan、Lin、Li 等人区分两种常被混称的“与人类对齐”:对齐人类偏好与对齐人类行为,并把二者的分布差异称为 Turing-test gap。

    深度解读完整解读
  2. 可解释性arXiv 2609.36138

    SAKIKO:对工具调用 LLM 内部干预的机制审计框架

    提出 SAKIKO 框架,审计工具调用 LLM 的定向激活干预是否构成修复

    发表
    场景
    AI Agent
    测试
    Phi-3.5-mini、Qwen2.5-7B、Llama-3.1-8B 等 8 个
    摘要SAKIKO 用目的地、保持和预注册不确定性裁定内部转向是否算修复。

    SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。

    深度解读完整解读
  3. 可解释性arXiv 2609.37737

    研究用因果激活修补定位模型服从提示注入指令的决策层

    用因果激活修补定位模型服从提示注入的决策层

    发表
    测试
    Phi-3-mini、Qwen3-4B、Qwen3-14B 等 7 个
    摘要合规的因果杠杆集中在网络后三分之一的低秩子空间,该层也是混淆下检测最好的位置。

    这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。

    深度解读完整解读
已经到底了