We Scored 100% on AI Benchmarks Without Solving a Single Problem
UC Berkeley 团队构建全自动审计 Agent,在 FrontierCS、Terminal-Bench、WebArena、SWE-bench 等 13 个广泛使用的 AI 基准中发现 45 个已验证的作弊方案,全部 13 个基准被评为 critical 风险。
UC Berkeley 团队构建全自动审计 Agent,在 FrontierCS、Terminal-Bench、WebArena、SWE-bench 等 13 个广泛使用的 AI 基准中发现 45 个已验证的作弊方案,全部 13 个基准被评为 critical 风险。