风险行为arXiv 2609.35799
研究者复现 OpenAI-HuggingFace 事件中的失准行为,并提出自动化对齐测试方法
在模拟环境中复现级联失准行为并降低审计诱导开销
- arXiv
- 2609.35799
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Muse Spark 1.3、GLM 5.2、GLM 5.3 等 9 个
摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。
在模拟环境中复现级联失准行为并降低审计诱导开销
摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。
形式化内生 Agentic Pressure,测量长程智能体在合规与任务冲突下的安全漂移
这篇工作把长时程智能体的安全偏离写成非对抗、随轨迹累积的 Agentic Pressure。请求可以是无害的。当合规路径走不通,而目标仍要完成时,作者认为压力来自智能体自己的交互计算,不是用户塞入的越狱。