跳到正文
10月10日 · 周六

全部论文

找到 41 篇

另有 244 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.09964

    研究比较连续训练阶段对大语言模型说服力的影响

    比较连续后训练阶段如何改变语言模型的说服力

    发表
    被测模型
    mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated、GPT-4
    摘要作者称说服性 SFT 提高失调模型的态度变化,IPO 无额外收益,GPT-4 不异于中性文本。

    作者用同一人类协议,把 LLM 说服力拆成阴谋数据上的失调 SFT、说服数据上的 SFT,以及其后的 IPO。

    深度解读完整解读
  2. 可解释性arXiv 2610.08559

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    分析 LLM 去偏激活方向,发现其编码置信度而非公平性

    发表
    被测模型
    Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个

    摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。

    深度解读完整解读
  3. 评测与基准arXiv 2610.06584

    论文:AI 在非公开漏洞上更帮攻击者还是防御者

    评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击

    发表
    被测模型
    Opus 5、GPT-5.6 Sol、GPT-6 Sol 等 10 个
    摘要攻防孰强随环境、系统和弱点改变。

    作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。

    深度解读完整解读
  4. 评测与基准arXiv 2610.03853

    报告评估 LLM Agent 选择和使用生物工具的能力

    评测 Agent 选择并早期操作高风险生物工具的能力

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 4.7、Gemini 3.1 Pro Preview、GPT-5.5 等 7 个
    摘要七模型能选工具并部分操作 EVEscape 与 ESM3。

    这项评估测量七个前沿 LLM 智能体与生物工具交互的最早两步:为设计任务选工具,以及在仓库里完成玩具级操作。作者关心的是,有生命科学背景但不会专门操作高风险工具的行为者,能否借此降低门槛。范围限于预测性、生成性工具。

    深度解读完整解读
  5. 防御arXiv 2610.03240

    通过模型路由与协作实现集体偏见缓解

    提出 CBM,用模型路由与多模型协作缓解群体偏见

    发表
    被测模型
    Qwen/Qwen2.5-32B-Instruct、Qwen/Qwen2.5-14B-Instruct、google/gemma-2-9b-it 等 7 个
    摘要CBM 用路由挑选模型并按拓扑协作,在若干设定下降低 BBQ 偏见分。

    CBM 是一个推理时的多模型去偏框架:用路由为查询选模型,再按拓扑协作,以降低社会偏见分。

    深度解读完整解读
  6. 其他arXiv 2610.01005

    基于容忍度的公平性审计:违规认证与敏感性筛查

    提出容忍度公平性审计,用 CEL 认证违规并用 SEL 筛查

    发表
    被测模型
    COMPAS
    摘要容忍阈值下,CEL 做违规认证,SEL 与 ASEL 做更敏感的筛查。

    这篇工作给出一套按审计目标切换校准的容忍公平审计:差异不必为零,而是看预先指定的不利方向上是否超过允许阈值。

    深度解读完整解读
  7. 其他arXiv 2609.40034

    ALeBi:用 bias probe 主动审计多群体公平性

    提出 k-ALeBi 偏差探针,主动审计黑盒模型的多组公平性

    发表
    被测模型
    linear model、random forest、MLP
    摘要偏差探针把多组公平审计变成比较函数学习,并分开审计与重构。

    k-ALeBi 把黑盒多组公平审计写成跨组比较函数的学习,而不是先重构分类器。

    深度解读完整解读
  8. 防御arXiv 2609.39107

    MASCRDM:面向大语言模型训练过程的合规风险检测与缓解多智能体系统

    提出 MASCRDM,在监督微调中实时检测并缓解偏见

    发表
    被测模型
    Qwen3-8B-Base、Llama-3.1-8B
    摘要MASCRDM 在 SFT 中按法规图谱检测数据、结构与损失风险,BBQ 总准确率在两模型上最高。

    MASCRDM 把 AI 法律规章编成知识图谱,再由五个智能体在 LLM 训练中做实时合规检测与缓解,实验以偏见与歧视为代表风险。

    深度解读完整解读
  9. 评测与基准arXiv 2609.39025

    面向算法公平性的 Rank Graduation 指标

    提出 Rank Graduation Fairness 指标,检验群体间预测误差负担是否可比

    发表
    被测模型
    logistic regression、random forest、gradient boosting 等 4 个
    摘要用误差排序、置换检验和特征移除评估信贷公平,HMDA 上四模型均拒绝零假设。

    用预测误差的排序分布、置换检验和特征移除,评估信贷模型在受保护群体间的公平。。

    深度解读完整解读
  10. 其他arXiv 2609.36054

    多作者论文评估 AI 研发自动化触发智能爆炸的可能与政策应对

    评估自动化 AI 研发触发智能爆炸的可能并提出政策应对

    发表
    摘要软件驱动智能爆炸可能把数年进展压进数月,作者要求三项政策先做好。

    Chan 等论证:自动化 AI 研发可能经软件反馈环形成智能爆炸,把本需数年的进展压进数月或更短。他们关心的不是换硬件的建设周期,而是 AI 扩大有效研发劳动力、再产出更强系统,以及社会能否在能力跃迁前看见、约束并适应这一过程。

    深度解读完整解读
  11. 风险行为arXiv 2609.35928

    论文发现暴露模型身份标签会削弱多智能体 LLM 合作

    发现暴露模型家族标签会让多智能体派系化并削弱合作

    发表
    被测模型
    Gemma (gemma-4-26B-A4B-it)、GPT-OSS (gpt-oss-20b)、Nemotron (NVIDIA-Nemotron-3-Nano-30B-A3B-BF16) 等 6 个
    摘要可见身份标签让异构 LLM 群体按标签结派,共识更慢、更贵,去掉标签后该行为消失。

    Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。

    深度解读完整解读
  12. 防御arXiv 2609.33086

    研究者提出基于评分量表的可解释奖励框架,将宪法转化为可调对齐目标

    提出可解释 rubric 奖励,将宪法转为可调权重并用于监督微调

    发表
    被测模型
    Gemma 3 12B、Qwen3 14B、GPT-OSS 20B
    摘要宪法级可解释奖励让优先级可检查、可改写,并带入训练后的行为。

    作者给出一条从通用宪法到可调训练奖励的路径,用来检查并改写模型实际被优化的优先级。

    深度解读完整解读
  13. 分析与理论arXiv 2609.32004

    论文指出消除人口统计信息的不变性约束可能制造新偏见

    分析消除人口统计信息的不变性约束如何制造新偏见

    发表
    被测模型
    Fair Normalizing Flows、MMD regularizer、adversarial 等 5 个
    摘要表示不变性不是公平的充分条件。

    这篇分析考察的是:为了公平而从潜表示中去掉人口统计信息,是否可取、是否足够。作者认为,表示能解码出群体归属,本身并不解释不公平。任务特征可以与群体相关,患病率不同时,抹平边际分布会迫使错误率在群体间分开。

    深度解读完整解读