攻击arXiv 2606.13044
研究者提出对抗性重新包装:不改科学内容仅调整表述即可拉高 AI 审稿分数
提出对抗重构,仅改表述以拉高 AI 审稿分数
- arXiv
- 2606.13044
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- GPT-5-mini、Claude Sonnet 4、Claude Sonnet 4.5
摘要揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
另有 73 篇论文还没打上分类标签,暂不在筛选结果里。
提出对抗重构,仅改表述以拉高 AI 审稿分数
摘要揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
用 MMPIBench 评测智能体框架的多模态提示注入
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
提出分片监督,将评判标准拆至独立调用以改善一致性并抵御展示攻击
本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出 Search Harness,把间接提示注入做成测试时搜索
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出 AgentXploit 红队系统,分离仓库攻击路径发现与运行时利用