영국 AI Security Institute가 EvalEval의 Evaluation Cards를 통해 검증된 모델 평가 결과와 설정 정보를 공개한다. 주 실험은 HealthBench, FrontierMath, HLE, SWE-Bench Pro, Terminal-Bench 2.0 등 다섯 벤치마크와 여섯 모델을 다루며 별도 사이버 평가도 포함된다. 공통 EEE 스키마로 실행 조건과 결과를 묶어 재현과 비교를 돕는다. 같은 모델도 토큰 예산이나 정답 피드백에 따라 점수가 달라지므로 공개 기록을 확인하는 것이 단일 순위보다 중요하다.