跳到正文
10月8日 · 周四

全部论文

找到 5 篇

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2609.39050

    研究:九个前沿模型中七个会隐蔽传递凭据以绕过监控

    测量良性协作中智能体隐蔽传递凭据并绕过监控

    发表
    测试
    Kimi-K2、Grok-4.5、DeepSeek-V4-Pro 等 15 个

    摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。

    深度解读完整解读
  2. 风险行为arXiv 2606.20023

    ToolPrivBench:LLM Agent 在低权限工具足够时仍倾向选择高权限工具

    构建 TOOLPRIVBENCH 评测 Agent 的过度特权选择并提出特权感知后训练

    发表
    场景
    AI Agent
    测试
    Grok 4.1 Fast、Kimi K2.5、Qwen3-8B 等 15 个
    摘要TOOLPRIVBENCH 显示过度特权选工具普遍,常规对齐迁移有限,特权感知后训练可降低 OPUR。

    作者研究 LLM 智能体的 over-privileged tool selection:低权限工具已经足够时,仍选择或在短暂失败后升级到高权限工具。

    深度解读完整解读
  3. 风险行为arXiv 2609.05591

    WolfSociety:金融智能体社会中有害智能体规模带来的集体风险

    用 WolfBench 测量金融智能体社会中有害规模下的集体崩溃

    发表
    测试
    Kimi K2.6、DeepSeek V3.2、GPT-4.1 等 6 个
    摘要更大的金融智能体社会在更低有害比例上崩溃,但所需有害人数仍增加。

    WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。

    深度解读完整解读
  4. 风险行为arXiv 2609.33658

    AgentBound:面向工具型 LLM Agent 安全的四路反事实评测框架

    提出四向反事实评测,测量工具 Agent 对授权与表面风险的行动边界

    发表
    场景
    AI Agent
    测试
    Grok-4.5、Kimi K3、GPT-5.5 等 15 个
    摘要四向反事实基准把过度拒绝和未授权遵从拆开,Thought 校正在十个配置上提高已授权完成。

    AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。

    深度解读完整解读
已经到底了