GPTProto

We Scored 100% on AI Benchmarks Without Solving a Single Problem

Berkeley RDI:Blog(AI 安全与评测)··Research Papers

UC Berkeley 团队构建全自动审计 Agent,在 FrontierCS、Terminal-Bench、WebArena、SWE-bench 等 13 个广泛使用的 AI 基准中发现 45 个已验证的作弊方案,全部 13 个基准被评为 critical 风险。