跳到正文
10月9日 · 周五

全部论文

找到 60 篇

另有 443 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角

    发表
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  2. 分析与理论arXiv 2610.10203

    研究者提出模型生物体多目标验证框架并给出训练建议

    提出模型生物多目标验证与合并训练方法以减少能力损伤

    发表
    摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。

    本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。

    深度解读完整解读
  3. 分析与理论arXiv 2610.06191

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    分析工具型 Agent 判定检索无用却不停止的原因

    发表
    场景
    AI Agent
    摘要论文揭示智能体判定工具失效却无法转化为停止行动,证实通过框架规则强制整合判定可提升表现。

    本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。

    深度解读完整解读
  4. 分析与理论arXiv 2610.02480

    MEA:面向忠实模型解释的奖励驱动多智能体系统

    提出奖励驱动多智能体系统 MEA,生成可扰动核对的忠实解释

    发表
    摘要MEA 用忠实性奖励训练双智能体,把工具输出收成可扰动核对的解释。

    MEA 是一个奖励驱动的双智能体,用来给黑盒分类器的单次预测写自然语言解释,并检查解释能否被扰动后的模型行为支持。

    深度解读完整解读
  5. 分析与理论arXiv 2610.05076

    自生成反馈会破坏测试时训练:长时程适应的因果分解

    因果分解自生成反馈如何破坏测试时训练的长时程适应

    发表
    摘要自写闭环损害真实文本预测。

    持久测试时更新若来自模型自己生成的文本,会同时改变模型和后续训练文本。作者在 PG-19 长流上分解这条闭环,并用独立文本决定是否提交更新。

    深度解读完整解读
  6. 分析与理论arXiv 2610.05036

    研究揭示 OSS 漏洞在 Agent 系统中的传播路径

    提出 Oscar,跨层溯源已知 OSS 漏洞在 Agent 系统中的已实现效应与表现边界

    发表
    场景
    AI Agent
    摘要Oscar 把已知 OSS 漏洞分析从“是否存在”推进到一次执行中的已实现效应与最远表现边界。

    Oscar 是面向已知 OSS 漏洞的运行时分析框架,用来判断一次智能体执行里该漏洞是否造成安全相关效应,以及效应最远表现到哪一层。。

    深度解读完整解读
  7. 摘要四层都可能在目标缺失时报告成功。

    作者讨论腿式机器人 RL 流水线中,奖励、课程门控、评测统计量和参考运动如何在物理目标缺失时仍报告成功。传统观点只把奖励当作会被优化、因而会偏离的代理。

    深度解读完整解读
  8. 分析与理论arXiv 2610.02886

    研究揭示无触发投毒审计缺口:事实答对不等于决策正确

    揭示无触发虚假训练下事实回答与下游决策的审计差距

    发表
    摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。

    论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。

    深度解读完整解读
  9. 分析与理论arXiv 2610.03095

    研究:异构 AI 模型间的说服效果取决于配对而非模型规模

    量化异构模型在一次分歧交换后对分类判断的同伴影响

    发表
    摘要一次分歧交换就能大幅改判,且组合行为不能从个体属性外推。

    这篇工作测量异构语言模型智能体在共同分类任务上的单次同伴影响,而不是评多智能体系统的整体基准分。

    深度解读完整解读
  10. 分析与理论arXiv 2610.03014

    AgentSecGraph:面向 LLM Agent 的安全感知依赖分析框架与 AgentSecBench 语料

    提出 AgentSecGraph,静态恢复 LLM Agent 敏感操作的安全依赖与上下文

    发表
    场景
    AI Agent
    摘要AgentSecGraph 用 Security-ADG 分开操作检测与安全解释,并量化上下文保留。

    AgentSecGraph 对冻结的 LLM 智能体源码做安全感知静态分析:敏感操作只作候选锚,Security-ADG 再记下它与智能体输入、依赖、信任边界、守卫和外部效果的关系。

    深度解读完整解读
  11. 分析与理论arXiv 2608.27924

    智能体记忆如何可靠处理不可回答问题:一项系统研究

    分析外部记忆对智能体可靠处理不可回答问题的作用

    发表
    场景
    AI Agent
    摘要记忆能选择性提高 UAQ 的可接受回应,但跨数据集不稳定,且更依赖可迁移的行为指导。

    这份研究在同一智能体框架里检查外部记忆会不会让不可回答问题的处理更稳,以及稳来自哪一种存储内容。

    深度解读完整解读
  12. 分析与理论arXiv 2608.16578

    研究用统计力学预测 AI 智能体群体的集体行为

    用扩展 Ising 模型预测语言模型智能体的集体意见演化

    发表
    摘要统计力学三耦合模型从初始意见预测智能体社群轨迹,并解释 conviction、共识与客观题求真。

    定位:用统计力学描述语言模型智能体社群的意见动力学,并从初始意见预测后续轨迹。

    深度解读完整解读
  13. 分析与理论arXiv 2609.32004

    论文指出消除人口统计信息的不变性约束可能制造新偏见

    分析消除人口统计信息的不变性约束如何制造新偏见

    发表
    摘要表示不变性不是公平的充分条件。

    这篇分析考察的是:为了公平而从潜表示中去掉人口统计信息,是否可取、是否足够。作者认为,表示能解码出群体归属,本身并不解释不公平。任务特征可以与群体相关,患病率不同时,抹平边际分布会迫使错误率在群体间分开。

    深度解读完整解读