SycoLens 研究:单一谄媚翻转率掩盖纠正与屈从的区别
构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从
- arXiv
- 2610.06522
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- opus-5、sonnet-5、sonnet-4.6 等 11 个
- 风险失准与价值偏离
摘要论文揭示施压句式、边界距离与格式偏置主导翻转率,提出系统解构纠错与顺从的综合评测方案。
本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。
构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从
本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。
提出 FAITHCONFLICT,测量对齐训练导致模型静默改写相悖输入
本文系统揭示并实证分析了语言模型后训练中存在的“能力–安全–忠实度”三元冲突。
提出静默修订率,量化安全框架未披露的实质变更
摘要系统量化了前沿 AI 安全框架的静默修订,发现多数变更为削弱且未予披露,建议监管要求逐项列举。
提出 MemoReason 基准,测量参数记忆对上下文推理的影响
MemoReason 用结构相同的事实–虚构文档配对,测量参数记忆如何影响大模型的上下文推理。
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出 SAGO,以语义等价变体上的逐例行为稳定性评测大模型泛化
SAGO 把 LLM 泛化改写成同一目标与上下文在语义等价表达下的逐例行为稳定性,而不是单一基准上的聚合准确率。。
构建 SciSlopBench 评测科学灌水,并用 SciSlopHarness 约束修订
提出 FIGS 双轴基准,评测多轮对话中的谄媚与校准性共情
FIGS 是一个固定的多轮评测套件,用来同时看模型会不会在压力下放弃事实,以及会不会在守住事实时忽略用户实际说过的感受。
用 CASCADE 在统一威胁模型下筛选跨阶段越狱防御组合
在共享目标调用预算下重评黑盒越狱并提出 ReCode
构建 CONTEXT CONFLICT 解释模型如何表征并化解语境知识冲突
CONTEXT CONFLICT 把问题从“参数知识对外部语境”转到“语境内部多来源证据互相冲突”,并同时给出数据、机制分析和一种无训练转向。
建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。
提出 FUSE 框架,评测大语言模型的化生危险能力
提出 VEX-Bench 评测 LLM 生成虚假信息的核查复杂度
VEX-Bench 把 LLM 虚假信息的风险从“能否生成”改成“筛查时会占用多少核查容量”。