跳到正文
10月10日 · 周六

全部论文

找到 963 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.12436

    研究提出 AI Agent 种群生态理论:协作带来起飞临界规模

    为失配智能体种群建立生态模型,说明协作产生起飞临界规模

    发表
    摘要作者称协作把起飞从个体能力阈值改成种群阈值,故小种群评估不够。

    作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。

    深度解读完整解读
  2. 分析与理论arXiv 2610.12409

    研究者对 HELM Safety 与 HarmBench 做心理测量学审查,质疑其分数能否代表单一属性

    审计 HarmBench 分数能否代表单一 harmful refusal 属性

    发表
    摘要作者称 HarmBench 不对应单一 harmful refusal,比较模型时应把行为分开。

    这是对 HELM Safety 中 HarmBench 的构念效度审计,检查 harmful refusal 能否作为单一属性来读分数。。

    深度解读完整解读
  3. 可解释性arXiv 2610.12361

    研究:法律推理模型引用法条不等于依据法条

    用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条

    发表
    被测模型
    Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
    摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。

    本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。

    深度解读完整解读
  4. 评测与基准arXiv 2610.12360

    论文提出 ISE 框架,评测 LLM Agent 在知识冲突下的认知谦逊

    提出 ISE 框架,评测 LLM Agent 在知识冲突下的认知谦逊

    发表
    场景
    AI Agent
    被测模型
    Nemotron-Orchestrator-8B、Claude Sonnet 4.6、GPT-5 等 5 个
    摘要ISE 轨迹评测显示,四个智能体的高任务准确率并不对应更高的认知谦逊。

    作者要测的不是智能体最终答得对不对,而是知识冲突出现时,它有没有在轨迹里认出缺口、做有界的工具跟进,并把没解决的不确定性写给用户。

    深度解读完整解读
  5. 攻击arXiv 2610.12292

    论文提出选项通道攻击:改一个选项标签即可让 Agent 护栏放行违规操作

    提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作

    发表
    攻击者
    黑盒
    被测模型
    LAYA-TD、LAYA-EN、LAYA-ML 等 5 个

    摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。

    深度解读完整解读
  6. 其他arXiv 2610.12235

    论文提出用语言模型充当 AI 研究世界模型,预测实验结果

    提出研究世界模型,用语言模型预测干预增益

    发表
    被测模型
    Claude Opus 5、Grok-4.6、GPT-6 Astra 等 13 个
    摘要作者称实验记录可在环境内外复用,并改善固定预算下的实验选择。

    作者把语言模型用作研究世界模型,在执行前预测干预增益的中位数,用来在有限预算下比较候选实验。要处理的缺口是研究智能体提案快于执行。同一类改动在不同参考模型、配方和预算下效果可以不同,因此需要能离开原环境继续使用的实验知识。

    深度解读完整解读
  7. 攻击arXiv 2610.11932

    复旦团队测量 AI 搜索引用脆弱性:普通发帖可进入引用与答案文本

    测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答

    发表
    被测模型
    Grok、Doubao、ChatGPT 等 10 个

    摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。

    深度解读完整解读
  8. 评测与基准arXiv 2610.11773

    研究提出 Agent 安全新维度:识别未履行的安全义务

    提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务

    发表
    被测模型
    ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
    摘要义务是护栏缺口。

    作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。

    深度解读完整解读
  9. 防御arXiv 2610.11754

    仅凭输出审查无法验证什么:面向研究智能体的研究契约

    提出研究合同,把已批准选择绑定到执行证据并由检查器核验

    发表
    被测模型
    OpenAI gpt-5.6-sol、OpenAI gpt-5.6-terra、OpenAI gpt-5.6-luna 等 18 个
    摘要研究合同暴露四类输出单独建不立的关系。

    研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。

    深度解读完整解读
  10. 防御arXiv 2610.11634

    LTBD:用可学习信任边界分隔符防御提示注入

    提出 LTBD,用可学习分隔符隔离可信指令与不可信数据

    发表
    被测模型
    Llama3-8B-Instruct、Llama3.1-8B-Instruct、Falcon3-7B-Instruct 等 4 个
    摘要LTBD 只训练四个分隔符嵌入。

    LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。

    深度解读完整解读
  11. 可解释性arXiv 2610.10865

    用路由稀疏自编码器解耦语音编码器中的语言学与副语言学信息

    提出路由 TopK SAE,把语音编码器稀疏码拆成语言与副语言通路

    发表
    被测模型
    SPEAR XLarge、WavLM Large
    摘要路由 SAE 在冻结 SPEAR 与 WavLM 上分开语言和副语言因子,探针与交换支持通路分工。

    TopK SAE 的稀疏码被分成语言通路与副语言通路,用来分开冻结语音编码器里同时存在的音素信息和说话人、情感、韵律。只重构不能得到作者选定的这一分解。语言通路由音素识别监督,副语言通路由说话人识别、情感分类和韵律预测监督,作用在对方通路上的梯度反转对抗用来压低交叉因子。

    深度解读完整解读