研究者提出对抗性重新包装:不改科学内容仅调整表述即可拉高 AI 审稿分数
提出对抗重构,仅改表述以拉高 AI 审稿分数
- arXiv
- 2606.13044
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- Claude Sonnet 4、Claude Sonnet 4.5、GPT-5-mini
摘要揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
另有 602 篇论文还没打上分类标签,暂不在筛选结果里。
提出对抗重构,仅改表述以拉高 AI 审稿分数
摘要揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
提出 CredLeak-Bench,评测 Agent 在钓鱼登录与收件箱中的凭据泄露
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出分片监督,将评判标准分配给独立调用以抵御展示攻击
本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 GraphProfiler,用个人知识图谱从帖子历史推断敏感属性并溯源
GraphProfiler 是一个可审计的 LLM 敏感属性画像器:用源链接个人知识图谱,把推断落到具体帖子。
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
提出 DEMI 检测框架,在执行前识别 DAO 提案描述与执行载荷的不匹配
Mind the Gap 把 DAO 提案的描述–执行不一致(DEMI)做成可在投票窗口内运行的检测问题。。
提出 LongPIBench,评测长文档场景下的提示注入攻击与防御
摘要论文构建长文本提示注入基准 LongPIBench,揭示启发式与优化攻击在长文档中的高有效性及现有防御的大幅失效。
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入