分析与理论arXiv 2610.03095
研究:异构 AI 模型间的说服效果取决于配对而非模型规模
量化异构模型在一次分歧交换后对分类判断的同伴影响
- arXiv
- 2610.03095
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- gemma-3-4b、gemma-3-27b、llama-3.1-8b 等 7 个
摘要一次分歧交换就能大幅改判,且组合行为不能从个体属性外推。
这篇工作测量异构语言模型智能体在共同分类任务上的单次同伴影响,而不是评多智能体系统的整体基准分。
另有 46 篇论文还没打上分类标签,暂不在筛选结果里。
量化异构模型在一次分歧交换后对分类判断的同伴影响
这篇工作测量异构语言模型智能体在共同分类任务上的单次同伴影响,而不是评多智能体系统的整体基准分。
提出 OpenMLE 全栈,用执行反馈后训练机器学习元进化智能体
作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
提出变长反馈编码 BAM,在生成文本中隐蔽传输秘密载荷
提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门
摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。
提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度
证明保留词元表示放大模板注入并验证分词缓解
摘要对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。