研究提出 AI Agent 种群生态理论:协作带来起飞临界规模
为失配智能体种群建立生态模型,说明协作产生起飞临界规模
- arXiv
- 2610.12436
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 风险失准与价值偏离
摘要作者称协作把起飞从个体能力阈值改成种群阈值,故小种群评估不够。
作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。
另有 242 篇论文还没打上分类标签,暂不在筛选结果里。
为失配智能体种群建立生态模型,说明协作产生起飞临界规模
作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。
审计 HarmBench 分数能否代表单一 harmful refusal 属性
这是对 HELM Safety 中 HarmBench 的构念效度审计,检查 harmful refusal 能否作为单一属性来读分数。。
诊断合规系统裁决是否随监管规则扰动而改变
用行为反事实和激活探针,审计合规裁决是否依赖所给规则。。作者要分开两种看起来一样的正确裁决:用了所给规则的,以及靠案例表面或训练模式得到的。
检验潜意识学习能否经无关数据蒸馏传递能力、后门与作弊
摘要作者报告潜意识学习可传递新技能、后门与作弊倾向,且分布外泛化强于单层转向向量。
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
论证发布时互信息不能认证开源权重抗微调恢复
作者研究开源权重模型的篡改抵抗:发布时的互信息是否足以保证微调恢复很慢。
分析记忆与泛化如何决定机器遗忘的 retain 损伤
作者考察学习方式如何左右 unlearning 的 retain damage:训练越依赖跨样本共享的解法,在匹配的遗忘程度上,retain 上的损失越大。
分析潜空间图像水印对像素扰动的内在鲁棒性上限
摘要作者称当前潜空间水印在低 FPR 下受扩张映射与分布偏移的限制。
论证 Lean 编译通过不能保证自然语言数学证明语义忠实
摘要论文论证了形式化编译不保证原证明正确,确立了消歧不可计算性理论,并揭示了 OpenAI 爆破证明中的具体脱节。
测量财务事实变少时身份对股权配置建议的替代
同一财务只改人设,测量披露变薄时股权建议里的身份替代。
证明短开头词可唤醒基模型推理,且效应来自训练数据
提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
提出 SAGE,定位代码修复 Agent 最早偏离安全意图的轮次
SAGE 在已通过语法和功能检查、但仍含确认安全缺陷的智能体修复轨迹上,定位最早可归因的安全意图偏离。。
揭示工具型智能体判定无用后仍不停止检索,并检验强制整合纠正效果
本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。
固定有害指令,单轴归因图像到文本越狱的图像属性
摘要固定文本的图像越狱拆解,只在 Qwen 上给出一条有界相关性归因。
遮挡审计 AdvWave-P 音频越狱的频带必要性与解码层关联
这是对加性音频越狱 AdvWave-P 的频率与解码器深度审计,受害模型主要是 Qwen2-Audio-7B-Instruct,不提出新攻击。
因果分解自生成反馈如何破坏测试时训练的长时程适应
持久测试时更新若来自模型自己生成的文本,会同时改变模型和后续训练文本。作者在 PG-19 长流上分解这条闭环,并用独立文本决定是否提交更新。
提出 Oscar,分析已知 OSS 漏洞在 Agent 系统中的安全效应与表现边界
Oscar 是面向已知 OSS 漏洞的运行时分析框架,用来判断一次智能体执行里该漏洞是否造成安全相关效应,以及效应最远表现到哪一层。。