攻击arXiv 2606.13044
研究者提出对抗性重新包装:不改科学内容仅调整表述即可拉高 AI 审稿分数
提出对抗重构,仅改表述以拉高 AI 审稿分数
- arXiv
- 2606.13044
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- GPT-5-mini、Claude Sonnet 4、Claude Sonnet 4.5
摘要揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
另有 66 篇论文还没打上分类标签,暂不在筛选结果里。
提出对抗重构,仅改表述以拉高 AI 审稿分数
摘要揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
用演化算法构造思维病毒并测量其在多智能体中的传播
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
检验儿童受众框架是否让前沿模型收敛到同一套架构母题
这项研究记录前沿模型在固定社交框架下的架构自述是否形成稳定回答盆地,并把该现象称为认识性越狱,而不是已核实的模型内部。
提出 VEX-Bench 评测 LLM 生成虚假信息的核查复杂度
VEX-Bench 把 LLM 虚假信息的风险从“能否生成”改成“筛查时会占用多少核查容量”。