- arXiv 2605.22949
MARGIN:面向多智能体基础模型协调的运行时置信度校准
论文提出 MARGIN(Multi-Agent Runtime Grading via Incremental Normalisation),一种运行时校准方法,无需重训练模型或留出校准集,即可从观测到的答案结果中学习各模型专属的置信度修正。
- arXiv
- 2605.22949
- 发表
- arXiv 2501.09223
《大语言模型基础》一书发布,覆盖预训练、对齐与推理六大主题
一本名为《Foundations of Large Language Models》的大语言模型基础书籍发布,全书共六章,分别覆盖预训练、生成模型、提示词、对齐、推理和推理能力等关键领域。
- arXiv
- 2501.09223
- 发表
- arXiv 2610.12235收录
论文提出用语言模型充当 AI 研究世界模型,预测实验结果
论文研究语言模型能否作为研究世界模型(RWM),预测候选干预在不同研究环境中的结果。
- arXiv
- 2610.12235
- 收录
- arXiv 2610.11942收录
LGWM:用动作条件世界模型验证 GUI 智能体的屏幕转移
论文提出 LGWM,一种无解码器、以动作为条件的世界模型,直接在观测编码空间中预测下一屏表示,把 GUI 智能体的安全验证简化为向量比较。
- arXiv
- 2610.11942
- 收录
- arXiv 2610.11932
复旦团队测量 AI 搜索引用脆弱性:普通发帖可进入引用与答案文本
复旦大学等机构的研究者提出一套测量框架,用于识别并测量从普通网络发帖进入 AI 搜索引用和答案文本的低门槛路径,结合跨平台引用映射、发布门槛测试和标记受控发文实验。
- arXiv
- 2610.11932
- 发表
- arXiv 2610.10619
TestJack 审计编码基准
哥伦比亚大学、UC Berkeley 等机构的研究者提出 TestJack,用动态演化的评测器审计编码基准中判定为通过的样本。
- arXiv
- 2610.10619
- 发表
- arXiv 2610.10612
PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器
研究者提出 PyCache Trap,把恶意行为放进与可见源码配对的 Python 编译缓存中,使扫描器检查的源码与运行时实际加载的字节码不一致。
- arXiv
- 2610.10612
- 发表
- 防御arXiv 2610.12463
论文复盘 OpenAI、Anthropic 与 Google Agent 安全事件并提出 PASAC 框架
提出 PASAC 与边界保证栈,把智能体评测越界纳入全周期可验证保证
- arXiv
- 2610.12463
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
- arXiv 2610.12436收录
研究提出 AI Agent 种群生态理论:协作带来起飞临界规模
论文提出 AI Agent 种群的生态理论,用种群增长方程描述失准 Agent 群体的扩张动态,其中适应度即增长率取决于网络安全能力。
- arXiv
- 2610.12436
- 收录
- 可解释性arXiv 2610.12361
研究:法律推理模型引用法条不等于依据法条
用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条
- arXiv
- 2610.12361
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。
本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。
- 攻击arXiv 2610.12292
论文提出选项通道攻击:改一个选项标签即可让 Agent 护栏放行违规操作
提出选项通道攻击,改写选项标签使 Agent 护栏放行违规操作
- arXiv
- 2610.12292
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 被测模型
- LAYA-TD、LAYA-EN、LAYA-ML 等 5 个
摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。
- arXiv 2610.11773收录
研究提出 Agent 安全新维度:识别未履行的安全义务
论文指出,仅识别 Agent 被禁止执行的动作不足以保障安全,还需识别应当执行却未执行的安全关键动作,作者称之为义务(obligation)。
- arXiv
- 2610.11773
- 收录
- 评测与基准arXiv 2610.11112
EpiReal-Bench:商用图像生成模型虚假声明红队基准
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
- arXiv
- 2610.11112
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
摘要四款商用图像模型能把假主张画成可信证据。
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
- 攻击arXiv 2610.10742
BRANCH 方法绕过 6 套多扫描器护栏系统
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
- arXiv
- 2610.10742
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 被测模型
- Meta Llama Guard 3 8B、Meta Llama Guard 7B、Meta Llama Guard 3 1B 等 18 个
- arXiv 2610.12360
论文提出 ISE 框架,评测 LLM Agent 在知识冲突下的认知谦逊
论文提出评测 LLM Agent 认知谦逊(EH)的框架,即 Agent 在任务执行中识别、处理并表达不确定性的意愿,并将其拆解为 Identify、Solve、Escalate 三个轨迹级行为维度。
- arXiv
- 2610.12360
- 发表
- arXiv 2610.11634收录
LTBD:用可学习信任边界分隔符防御提示注入
论文提出可学习信任边界分隔符(LTBD),一种在输入中显式编码信任边界、不改变 LLM 参数的轻量防御方法,用少量可学习分隔符区分可信用户指令与不可信外部数据,使模型更好遵循预期的信任层级。
- arXiv
- 2610.11634
- 收录
- arXiv 2610.10560收录
地球科学中 AI 模型的战略性治理
基于天气与气候数据预训练的 AI 基础模型正被微调用于远超天气预报的地球科学任务,其发展速度已超过科学界的评估能力。
- arXiv
- 2610.10560
- 收录