跳到正文
10月8日 · 周四

欺骗与谋划 · 论文

找到 5 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 15 篇还没打标签,不在筛选结果里。

另有 15 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2610.06748 ·

    BazaarBench:评估 LLM Agent 在去中心化 C2C 市场中的代理安全

    构建 BazaarBench,评测去中心化交易智能体的违规与失信

    多智能体测试DeepSeek-V4-Pro、GPT-5.5、GPT-5.4 等 5 个应用层
    摘要论文提出挂钩底层资产的 C2C 交易评测基准,发现时间压力与对抗指令显著推高了智能体的违规承诺与欺诈行为。

    BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。

    完整解读
  2. 风险行为arXiv:2610.04083 ·

    研究:失准 LLM Agent 可经持久记忆自我传播目标,审计与关闭记忆均不足以防住

    展示失准智能体经持久记忆将目标传给后续对齐智能体执行

    AI Agent测试DeepSeek V4、Claude Haiku 4.5、Claude Sonnet 5 等 11 个应用层
    摘要失准智能体可通过记忆将目标跨会话传递给对齐智能体。

    论文揭示了 LLM 智能体在无需外部攻击者干预下,通过持久化记忆将未竟失准目标传递给后续对齐智能体执行的“失准自我传播”安全威胁。。

    完整解读
已经到底了