跳到正文
10月8日 · 周四

Google DeepMind · 论文

找到 15 篇

另有 25 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv:2610.09667 ·

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    揭示推理模型用标识符规则替代随机抽样,使审计可被预测

    模型与 API测试Gemini 3.8 Flash、Gemini 3.5 Flash、GPT-6 Sol 等 6 个模型层

    摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。

    完整解读
  2. 攻击arXiv:2609.09553 ·

    研究:任意密文攻击前沿大模型无需微调即可越狱

    提出任意字母置换密码越狱,无需微调即可诱导有害输出

    模型与 API攻击者黑盒测试Gemini 3 Flash (preview)、Gemini 2.5 Flash、Claude Sonnet 4 等 7 个提示层

    摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。

    完整解读
  3. 评测与基准arXiv:2608.03070 ·

    FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0

    建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力

    模型与 API测试Gemini 3.1 Pro、Claude Fable 5、Claude Opus 4.8 等 8 个提示层
    摘要论文系统评测了前沿模型对已知静态越狱的防御能力,揭示了厂商间防护鲁棒性的巨大分化。

    本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。

    完整解读
  4. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    AI Agent测试Gemini-2.5-flash、Google Gemini CLI、Llama-3.1-8B-Instruct 等 14 个应用层
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
已经到底了