研究者复现 OpenAI-HuggingFace 事件中的失准行为,并提出自动化对齐测试方法
在模拟环境中复现级联失准行为并降低审计诱导开销
完整解读
在模拟环境中复现级联失准行为并降低审计诱导开销
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
提出 EvasionBench,测量任务压力下智能体对同步监控的规避
完整解读