跳到正文
10月9日 · 周五

全部论文

找到 14 篇

另有 466 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2609.38096

    Tail-Influence Sampling:面向 CVaR 策略评估的尾部影响采样

    提出 Tail-Influence Sampling,按尾部影响分配查询以估计策略下尾 CVaR

    发表
    测试
    Granite-4.2-8B、Qwen3-4B-Instruct-2507、Phi-4-mini-instruct 等 6 个
    摘要TIS 用尾部影响分配条件查询估 CVaR。

    在条件转移可独立查询时,用 tail influence 把固定评测预算分给对一条固定策略的下尾 CVaR 更重要的 kernel。平均回报相近时,罕见失败仍可能差很多。完整 rollout 把大部分预算花在到不了最坏状态的转移上。

    深度解读完整解读
  2. 攻击arXiv 2607.12340

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持

    发表
    测试
    Granite 3.3 8B、Nemotron-Cascade-2 30B、GLM-4.5-Air 等 10 个
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    深度解读完整解读
  3. Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息

    构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御

    发表
    测试
    Granite Guardian 3.3-8B、NeMo Guardrails、Gemma-4-31B-IT 等 11 个

    摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。

    深度解读完整解读
  4. 攻击arXiv 2610.01768

    LLMLeak:借 LLM 合法网页抓取实施隐蔽数据外泄

    提出 LLMLeak,把机密编进报错 URL,借聊天机器人网页抓取外传

    发表
    场景
    AI Agent
    测试
    IBM-Granite-3.3-8b-instruct、Meta-Llama-3.3-70B-Instruct、Meta-Llama-4-Scout-17B-16E-Instruct 等 15 个
    摘要LLMLeak 用报错 URL 借聊天机器人抓取外传秘密。

    LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。

    深度解读完整解读
  5. 风险行为arXiv 2609.35928

    论文发现暴露模型身份标签会削弱多智能体 LLM 合作

    测量公开模型家族标签引发的多智能体派系化与合作下降

    发表
    测试
    Nemotron (NVIDIA-Nemotron-3-Nano-30B-A3B-BF16)、Gemma (gemma-4-26B-A4B-it)、GPT-OSS (gpt-oss-20b) 等 6 个
    摘要可见身份标签让异构 LLM 群体按标签结派,共识更慢、更贵,去掉标签后该行为消失。

    Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。

    深度解读完整解读
  6. 其他arXiv 2609.39982

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    提出 Mid-Harness,在执行前验证并选择终端智能体的候选动作

    发表
    测试
    Nemotron3.5 Lightning、Nemotron3 Ultra、TMAX-9B 等 8 个
    摘要Mid-Harness 在执行前选择候选动作。

    Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。

    深度解读完整解读
  7. 分析与理论arXiv 2609.38324

    研究:多智能体讨论中异议被压制时收益下降

    用意见动力学模型解释多智能体讨论何时优于多数投票

    发表
    测试
    nemotron、glm-flash、seed 等 9 个
    摘要讨论增益由压抑率相对 c∗=γ/(γ+a) 的裕度决定,关闭推理或减少压抑可增大该增益。

    作者用一个只含四类行为的意见动力学,解释 LLM 团队讨论何时优于多数投票、何时停在错误共识。

    深度解读完整解读
  8. 攻击arXiv 2609.28585

    论文提出持久计费状态概念,揭示工具调用 LLM Agent 的拒绝钱包攻击与防御

    提出工具调用 Agent 的拒绝钱包攻击及主机侧计费约束

    发表
    场景
    AI Agent
    测试
    Nemotron-120B、GPT-4o、GPT-4o-mini 等 9 个
    摘要已准入工具返回的跨轮保留会重复计费。

    这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。

    深度解读完整解读
  9. 评测与基准arXiv 2609.33658

    AgentBound:面向工具型 LLM Agent 安全的四路反事实评测框架

    提出四向反事实评测,测量工具 Agent 对授权与表面风险的行动边界

    发表
    场景
    AI Agent
    测试
    Nemotron-Nano-9B-v2、Granite-3.3-8B-Instruct、GPT-5.5 等 15 个
    摘要四向反事实基准把过度拒绝和未授权遵从拆开,Thought 校正在十个配置上提高已授权完成。

    AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。

    深度解读完整解读
已经到底了