FindTheFlaws:用于检测推理缺陷与可扩展监督研究的标注错误数据集(原文,在新标签页打开)
构建 FindTheFlaws 并评测模型发现长解答推理缺陷的能力。
构建 FindTheFlaws 并评测模型发现长解答推理缺陷的能力。
新加坡管理大学等机构的研究者提出 CORVUS,用 LoRA 伪装内部遥测以绕过幻觉检测器。
推荐理由论文给出白盒模型侧攻击的完整方法、跨四个开源模型的迁移结果与逐项消融,可据此评估内部遥测类幻觉检测器的可靠性边界。
论文提出 RoguePrompt,一种自动化越狱流水线,通过将违禁提示词拆分并施加 ROT-13 与 Vigenère 两层嵌套编码,再附上自然语言解码指令,把违禁请求伪装成看似无害的提示词,诱导模型在单次查询内自行重构并执行原始意图。
提出 AuthBench 评测编码 Agent 最小权限,并验证充足性-紧缩性分解。
推荐理由论文提出权限边界推断任务与 AuthBench 基准,并给出无需训练即可降低攻击成功率的分解方法,适合关注 Agent 权限设计的团队参考。
论文提出 EmoRAG,指出检索增强生成(RAG)系统对细微符号扰动高度敏感:在查询中注入单个表情符号 token(如 (@_@))。
研究者提出把有害提示词改写为集合论、形式逻辑、量子力学等连贯数学问题,可高比例绕过 LLM 的安全过滤。
提出 MetaBreak,用特殊 token 操纵越狱在线 LLM 服务并绕过审核。
提出 DECEIVE-AFC,以声明改写诱导搜索增强事实核查误判。
研究者提出 ExistBench 基准,用于评测大语言模型生成内容是否包含潜在生存性威胁,即暗示或推动直接危害人类生存的输出。
评测多语言与编码混淆提示下模型生成钓鱼与键盘记录内容的遵从。
研究者提出 MEEA(Mere Exposure Effect Attack),一种受心理学曝光效应启发的全自动黑盒多轮越狱框架,通过重复低毒性语义暴露逐步侵蚀模型的安全对齐约束。
解释自回归一致性如何导致浅层安全对齐,并提出随机插入攻击。
提出多轮在线骚扰 Agent 基准,评测记忆、规划与微调越狱。
提出 SeedHijack,劫持采样 PRNG 以强制选定 token。
研究者提出 BreakFun 越狱方法,把有害请求包装成代码执行模拟:提示词给出一个无害的 Python 类定义即 Trojan Schema,要求模型回答这段代码运行会打印什么,模型必须实例化对象并为每个字段编造取值,而对抗性字段名把这些取值引向攻击目标,有害内容因此作为模拟实例化的副作用出现而非直接回答。
提出 CodeSpear 越狱,借语法约束解码生成恶意代码,并给出 CodeShield 防御。
推荐理由论文揭示语法约束解码本身可被用作越狱面,并给出配套的代码模态对齐方案,对部署代码生成服务的团队有直接参考价值。
提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器。
推荐理由论文披露商业多模态系统安全过滤依赖恶意内容显式可见的假设,并给出跨模态隐藏载荷的完整攻击链与实测成功率。
提出 DAPRO,为多轮 LLM 评测动态分配预算并构造事件轮数预测界。
提出 JAWS-Bench,评测代码 Agent 在三级工作区中的越狱与恶意代码可执行性。
推荐理由论文给出三种工作区攻击场景与可执行性判定流程,并量化了代码上下文如何削弱拒答,可供设计 Agent 权限与执行门控时参考。
提出多轮多模态越狱,并用 FragGuard 拦截有害响应。
提出约束对抗搜索红队框架,系统发现模型多类鲁棒性漏洞。
构建 MultiTurnPSB,评测四轮医疗越狱与分类器输入防御。
推荐理由论文用四轮对话基准揭示单轮评测看不到的模型安全差距,并给出分类器干预与假阳性代价的量化结果。
提出自适应攻击框架,击穿越狱与提示注入防御。
复评前沿模型代码生成中的包名幻觉与抢注攻击面。
推荐理由论文在五个前沿模型上复现包名幻觉测量,并给出跨模型共同幻觉的包名集合与仍可注册的子集,可供评估 slopsquatting 攻击面。
提出 RedDiff,用强化扩散生成图像审计 VLM 情境安全失效。
提出 MemoAttack,用技能结构化记忆做黑盒越狱。
提出字符级扰动与遗传算法去除 LLM 水印。
研究者提出 VideoSTF 基准框架,系统测量、压力测试并利用视频大语言模型(VideoLLM)的输出重复失败模式,即解码器陷入重复短语或句子的自我强化循环。
Meta FAIR 与马里兰大学研究者提出 RL-Hammer,从零训练攻击模型经工具输出实施提示注入。
提出 MM-Plan 多模态越狱框架,自动规划多轮图像编辑以越狱视觉独占目标。
研究者提出 ContextLeak,一个用于实证测量上下文学习(ICL)中最坏情况信息泄露的框架。
提出 TIP,用树搜索为 MCP 响应生成隐蔽注入载荷。
AWS AI Labs 研究者提出 STAC 框架,把恶意目标拆成多轮看似无害的工具调用链。
测量内容保留的修辞改写如何改变 AI 审稿分数。
提出 prompt-in-content 攻击,用上传文档指令劫持摘要。
建模并利用多智能体网络中子智能体生成时的记忆继承漏洞。
用对抗缺陷报告诱导自动程序修复系统生成不安全补丁。
中山大学、山东大学、北京大学与香港科技大学的研究者提出 MOSAIC,用 CLI 安全知识库构造编码 Agent 的命令组合攻击。
推荐理由论文提出 CLI 命令组合风险,用 CVE 与 PoC 蒸馏知识库生成攻击链,在五款编码 Agent 上给出成功率并测试五类防御。
提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发。
构建 ASPI 基准,评测 Agent 寻求澄清时的提示注入脆弱性。
推荐理由论文用配对实验隔离出澄清状态这一新攻击面,并给出十款模型的攻击成功率变化,可供部署交互式 Agent 的团队重新评估评测口径。