跳到正文
10月10日 · 周六

全部论文

找到 13 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 216 篇还没打标签,不在筛选结果里。

另有 216 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.03240

    通过模型路由与协作实现集体偏见缓解

    提出 CBM,用模型路由与多模型协作缓解群体偏见

    发表
    被测模型
    Qwen/Qwen2.5-32B-Instruct、Qwen/Qwen2.5-14B-Instruct、google/gemma-2-9b-it 等 7 个
    摘要CBM 用路由挑选模型并按拓扑协作,在若干设定下降低 BBQ 偏见分。

    CBM 是一个推理时的多模型去偏框架:用路由为查询选模型,再按拓扑协作,以降低社会偏见分。

    深度解读完整解读
  2. 评测与基准arXiv 2610.02874

    SceneFactory-3D:将 2D 交通场景提升为 3D 物理反事实以做安全评测

    提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性

    发表
    被测模型
    Frozen L0、L0-T、L1 等 5 个
    摘要SceneFactory-3D 固定场景只改路况。

    SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。

    深度解读完整解读
  3. 攻击arXiv 2609.39788

    研究:多智能体系统潜在通信链路可被训练用于提升有害顺从

    提出只训练或篡改多智能体潜在通信链路来提高有害遵从

    发表
    被测模型
    Llama-3.2-3B-Instruct、Qwen2.5-3B-Instruct、Gemma-3-1B-IT 等 7 个
    摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。

    学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。

    深度解读完整解读
  4. 风险行为arXiv 2609.38296

    印第安纳大学 OSoMe 研究:LLM 之间顺着原有立场共振比硬说服更易激进化

    比较智能体对话中共振与说服对信念激进化的效果

    发表
    被测模型
    Llama-3.1-8B-Instruct、Qwen3-8B
    摘要两智能体实验中,作者称共振比说服更能激进化,并会波及相关信念。

    作者用两个 LLM 智能体的对话,考察一方能否把另一方扮演的人格信念推向更极端。

    深度解读完整解读
  5. 风险行为arXiv 2609.35928

    论文发现暴露模型身份标签会削弱多智能体 LLM 合作

    发现暴露模型家族标签会让多智能体派系化并削弱合作

    发表
    被测模型
    Gemma (gemma-4-26B-A4B-it)、GPT-OSS (gpt-oss-20b)、Nemotron (NVIDIA-Nemotron-3-Nano-30B-A3B-BF16) 等 6 个
    摘要可见身份标签让异构 LLM 群体按标签结派,共识更慢、更贵,去掉标签后该行为消失。

    Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。

    深度解读完整解读
  6. 评测与基准arXiv 2609.15017

    PIDS-Bench:在过度防御、混淆与分布偏移下评测提示注入检测器

    提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现

    发表
    被测模型
    TF-IDF + logistic regression、DistilBERT、DeBERTa-v3-FT 等 7 个
    摘要PIDS-Bench 显示高分布内 F1 仍会过度拦截外部来源的安全相关良性输入。

    PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。

    深度解读完整解读
  7. FairMedAgent:临床 LLM 智能体公平性审计中的随机噪声下限

    用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限

    发表
    被测模型
    claude-haiku-4-5、claude-sonnet-5、llama3.1:8b-instruct 等 7 个
    摘要先测同一输入下的动作不一致率,再用它解读人口学翻转率。

    FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。

    深度解读完整解读
  8. 防御arXiv 2608.12361

    基于搜索增强 LLM 的中文新词毒性共识检测框架 SeTox

    提出 SeTox 检索增强框架,检测中文新词的隐性毒性

    发表
    被测模型
    SeTox-Qwen2.5-7B
    摘要SeTox 用检索把公共共识接入静态 LLM,以检测中文毒性新词。

    SeTox 研究中文新词上的隐性毒性检测:词表加检索增强,使静态 LLM 在不重训练的情况下利用公开网页上下文。

    深度解读完整解读
已经到底了