跳到正文
10月10日 · 周六

全部论文

找到 436 篇
筛选5

另有 427 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2610.10064

    研究者提出理解审计机制,以缓解自动化 AI 研究带来的风险

    提出 comprehension audits,以人类理解证据作为继续研发门槛

    发表
    摘要理解审计把出示人类理解设为继续研发的门禁,并报告开源评审评论率下降。

    本文是一份研发过程保障提案:用 comprehension audits 检验责任人是否理解 AI 参与产生的研发贡献,未达标就暂停后续开发与依赖该贡献的发布。。

    深度解读完整解读
  2. 评测与基准arXiv 2610.10062

    研究:Agent 更依赖工具报错通道

    测量工具调用 Agent 对显式报错与静默损坏的检测和恢复

    发表
    场景
    AI Agent
    被测模型
    claude-haiku-4.5-thinking、claude-haiku-4.5、deepseek-r1 等 6 个
    摘要作者称智能体看错误通道而非返回内容,静默损坏更少被当作问题。

    作者在 BFCL 多轮可执行环境上注入一次工具层故障,把注意到、改计划、恢复和重复分开记分,而不是只看任务有没有做完。

    深度解读完整解读
  3. 评测与基准arXiv 2610.09944

    AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠

    提出 AgentTime 基准,评测智能体按时长工作与估时能力

    发表
    被测模型
    Fable 5.1、GPT-5.6 Sol、GPT-6 Astra 等 7 个
    摘要作者把完成任务和管理所用时间分开。

    AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。

    深度解读完整解读
  4. 防御arXiv 2610.09793

    用时序逻辑监控工具 Agent

    提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链

    发表
    场景
    AI Agent
    攻击者
    黑盒
    摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。

    这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。

    深度解读完整解读
  5. 评测与基准arXiv 2610.09581

    研究审计 LLM 读取 Agent 日志的取证能力:答案正确但引用来源多为猜测

    评测 LLM 审计 Agent 日志时来源重建是否有证据支持

    发表
    场景
    AI Agent
    被测模型
    gpt-5.6-luna、claude-sonnet-4-6、gpt-5.4-mini-2026-03-17 等 5 个
    摘要保存执行范围的标识绑定,才能把猜中的引用和证据支持的引用分开。

    包级审计检查保存的智能体动作里,哪些来源结论能被交给分析者的记录支持。

    深度解读完整解读
  6. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  7. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作

    发表
    场景
    web agent
    被测模型
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  8. 防御arXiv 2610.08761

    VeriFine:通过扩展验证实现具身推理的自我改进

    提出 VeriFine,用双环协同扩展验证以实现具身推理自我改进

    发表
    被测模型
    Alpamayo 1.5 8B、Qwen3-VL 2B、Claude Opus 5
    摘要VeriFine 用双环协同演化具身推理的策略、课程和评审,驾驶与导航的策略分和评审对齐都上升。

    VeriFine 把驾驶和导航推理的自改进写成策略、课程和无参考评审的协同演化,用来处理固定评审跟不上新失败模式的问题。

    深度解读完整解读
  9. 防御arXiv 2610.08082

    POLAR:面向小型工具调用智能体的可逆性护栏框架

    提出 POLAR 本体门控,在执行前否决不可逆工具调用

    发表
    场景
    AI Agent
    被测模型
    qwen/qwen3-8b、meta-llama/llama-3.1-8b-instruct、nvidia/nemotron-nano-9b-v2 等 6 个
    摘要训练无关的事前可逆性门控,弱 airline 模型有收益,强模型与 retail 常回落。

    POLAR 是训练无关的事前门控,用类型化本体在工具调用执行前检查能否组成候选逆序列。

    深度解读完整解读
  10. 评测与基准arXiv 2610.07967

    DecepEval:覆盖 28 个专业场景的 LLM 智能体欺骗评测基准

    构建基准 DECEPEVAL,评测 LLM 智能体在外部条件下的欺骗

    发表
    场景
    AI Agent
    被测模型
    Claude Haiku 4.5、Claude Sonnet 5、Claude Opus 5 等 9 个
    摘要DECEPEVAL 用配对诱导比较智能体欺骗。

    DECEPEVAL 是一个评测 LLM 智能体欺骗如何随任务、职业场景和外部条件变化的基准。

    深度解读完整解读
  11. 防御arXiv 2610.07935

    SIGMA:让模型依据 Model Spec 自我改进安全对齐

    提出 SIGMA,让模型依据 Model Spec 自造对齐数据并改进安全对齐

    发表
    场景
    AI Agent
    被测模型
    Qwen3.6-27B
    摘要SIGMA 用 Model Spec 自造监督,单轮训练可迁到多项智能体安全指标。

    SIGMA 让 Qwen3.6-27B 只凭 Model Spec 和高层领域,自己生产对齐任务、评分细则和奖励。

    深度解读完整解读