攻击arXiv 2606.13044
研究者提出对抗性重新包装:不改科学内容仅调整表述即可拉高 AI 审稿分数
提出对抗重构,仅改表述以拉高 AI 审稿分数
- arXiv
- 2606.13044
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- Claude Sonnet 4、Claude Sonnet 4.5、GPT-5-mini
摘要揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
另有 558 篇论文还没打上分类标签,暂不在筛选结果里。
提出对抗重构,仅改表述以拉高 AI 审稿分数
摘要揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
提出 OBELISK 三级流水线,权衡恶意软件检测的准确率、开销与鲁棒性
OBELISK 把 Windows PE 恶意软件检测做成 YARA、EMBER-GBDT 与 Nebula 的顺序流水线,用来同时看检出、计算开销和对抗鲁棒性。
提出 ALIBI,向恶意二进制注入不执行掩护叙事使分析器误判为良性
ALIBI 是针对 LLM 恶意软件分诊的语义掩护叙事攻击:不覆盖系统指令,而把仍可见的可疑静态证据重释成良性安全产品的预期行为。
发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
提出 VirusCascade,劫持推荐智能体协同反思以定向推广物品
提出 LongPIBench,评测长文档场景下的提示注入攻击与防御
摘要论文构建长文本提示注入基准 LongPIBench,揭示启发式与优化攻击在长文档中的高有效性及现有防御的大幅失效。
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入