跳到正文
10月10日 · 周六

全部论文

找到 201 篇

另有 350 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.10150

    论文指出 LLM 漏洞修复基准可靠性受评测设计影响

    用对照实验隔离评测设计对漏洞补丁基准得分的影响

    发表
    被测模型
    Claude Sonnet 4.0、Claude Sonnet 4.5、Claude Opus 4.7
    摘要作者认为评测流水线会改变补丁基准分数,PoC 通过率高于开发者测试通过率。

    作者把 LLM 漏洞补丁基准的评测流水线当作会改变测量结果的对象,并明确说本文不是再做一个用于排名的基准。

    深度解读完整解读
  2. 评测与基准arXiv 2610.10062

    研究:Agent 更依赖工具报错通道

    测量工具调用 Agent 对显式报错与静默损坏的检测和恢复

    发表
    场景
    AI Agent
    被测模型
    claude-haiku-4.5-thinking、claude-haiku-4.5、deepseek-r1 等 6 个
    摘要作者称智能体看错误通道而非返回内容,静默损坏更少被当作问题。

    作者在 BFCL 多轮可执行环境上注入一次工具层故障,把注意到、改计划、恢复和重复分开记分,而不是只看任务有没有做完。

    深度解读完整解读
  3. 评测与基准arXiv 2610.09964

    研究比较连续训练阶段对大语言模型说服力的影响

    比较连续后训练阶段如何改变语言模型的说服力

    发表
    被测模型
    mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated、GPT-4
    摘要作者称说服性 SFT 提高失调模型的态度变化,IPO 无额外收益,GPT-4 不异于中性文本。

    作者用同一人类协议,把 LLM 说服力拆成阴谋数据上的失调 SFT、说服数据上的 SFT,以及其后的 IPO。

    深度解读完整解读
  4. 评测与基准arXiv 2610.09944

    AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠

    提出 AgentTime 基准,评测智能体按时长工作与估时能力

    发表
    被测模型
    Fable 5.1、GPT-5.6 Sol、GPT-6 Astra 等 7 个
    摘要作者把完成任务和管理所用时间分开。

    AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。

    深度解读完整解读
  5. 评测与基准arXiv 2610.09581

    研究审计 LLM 读取 Agent 日志的取证能力:答案正确但引用来源多为猜测

    评测 LLM 审计 Agent 日志时来源重建是否有证据支持

    发表
    场景
    AI Agent
    被测模型
    gpt-5.6-luna、claude-sonnet-4-6、gpt-5.4-mini-2026-03-17 等 5 个
    摘要保存执行范围的标识绑定,才能把猜中的引用和证据支持的引用分开。

    包级审计检查保存的智能体动作里,哪些来源结论能被交给分析者的记录支持。

    深度解读完整解读
  6. 评测与基准arXiv 2610.08662

    ParanoiaEval:编码智能体不必要风险处置评测基准发布

    提出 ParanoiaEval 评测编码智能体的不必要风险处置

    发表
    被测模型
    Opus-5、Sonnet-5、Sonnet-4.6 等 8 个
    摘要作者用证据受控任务对评测风险处置,称其普遍、独立于任务能力并降低满意度。

    作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。

    深度解读完整解读
  7. 评测与基准arXiv 2610.08540

    论文提出按风险类别测量的对齐缩放定律框架

    提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化

    发表
    被测模型
    Pythia (14m–2.8b)、Qwen2.5 (0.5B–72B)、Qwen2.5-Instruct (0.5B–14B) 等 4 个
    摘要论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。

    本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。

    深度解读完整解读
  8. 评测与基准arXiv 2610.07967

    DecepEval:覆盖 28 个专业场景的 LLM 智能体欺骗评测基准

    构建基准 DECEPEVAL,评测 LLM 智能体在外部条件下的欺骗

    发表
    场景
    AI Agent
    被测模型
    Claude Haiku 4.5、Claude Sonnet 5、Claude Opus 5 等 9 个
    摘要DECEPEVAL 用配对诱导比较智能体欺骗。

    DECEPEVAL 是一个评测 LLM 智能体欺骗如何随任务、职业场景和外部条件变化的基准。

    深度解读完整解读
  9. 评测与基准arXiv 2610.07762

    ES-Trace 审计 26 个代码模型的伦理采购披露,仅看 Model Card 平均得分 1.77/5

    提出 ES-Trace,审计代码生成模型模型卡内外的伦理来源披露

    发表
    被测模型
    santacoder、starcoder、CodeLlama-34b-Instruct-hf 等 19 个
    摘要顺着声明引用审计后披露分数上升,但社会与劳动方面仍然少有证据。

    ES-Trace 是一套参考感知的披露审计,用来测量代码生成模型的公开文档里能观察到多少 ES-CodeGen 证据。

    深度解读完整解读
  10. 评测与基准arXiv 2610.07753

    SafeActBench 发布:工具型 Agent 在证据到行动链上的失败模式

    构建 SAFEACTBENCH 评测工具型 Agent 的证据到行动失败

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 5、GPT-5.6 Sol、DeepSeek-V4-Flash 等 5 个
    摘要作者称失败常起于调查不足或过早行动,证据齐后的单步则少失败。

    SAFEACTBENCH 评测工具智能体的 consequential actions 是否由行动前已建立的证据支持,而不是只看终态对不对。

    深度解读完整解读
  11. 评测与基准arXiv 2610.07519

    论文提出针对手语翻译与儿童安全过滤交叉地带的部署前审计框架

    提出手语转文本接入儿童安全过滤的部署前审计协议

    发表
    摘要作者提议聋人知情的部署前审计,以检查手语转文本是否改变儿童安全决策。

    手语儿童到达基于文本的儿童安全机制时,机制看到的是机器翻译,不是儿童所做的手语。作者要解决的是:这条边界在部署前应如何审计。

    深度解读完整解读