跳到正文
10月9日 · 周五

Agent 安全 · 论文

找到 2 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 226 篇还没打标签,不在筛选结果里。

另有 226 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.03055

    HackTrace:用生成状态监督检测代码生成中的奖励作弊

    提出 HACKTRACE,用生成期激活检测代码智能体的奖励作弊

    发表
    测试
    CodeBERT、Qwen3-8B、Llama-3.1-8B-Instruct 等 4 个

    摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。

    深度解读完整解读
  2. 风险行为arXiv 2609.33871

    论文提出测量 LLM 社会自组织的框架,并揭示群体层面病理现象

    提出熵序参量框架,测量 LLM 社会的群体自组织

    发表
    测试
    Phi-4 (mini-instruct)、GPT-4.1 (longco-2025-04-14)、GPT-4o (2024-05-13) 等 5 个
    摘要熵序参量显示三个 LLM 社会自组织,另两个系统停在不动点。

    de Wynter 用复杂系统里的序参量,测量 LLM 社会会不会出现不在任何单个智能体身上的自组织,并主张这种诊断不依赖自然语言,也不绑定某一模型版本。问题来自群体层事件:一部分智能体通过通信协调,个体拒绝或个体监控都可能看不到该过程。框架把活动划成类别,用窗口内人均 Shannon 熵 Φ 相对二分配置零模型的偏离作为自组织证据,再用拉伸指数的 β 或 logistic 的 k 描述弛豫有多陡。

    深度解读完整解读
已经到底了