영국 AI Security Institute가 EvalEval의 Evaluation Cards를 통해 검증된 모델 평가 결과와 설정 정보를 공개한다. 주 실험은 HealthBench, FrontierMath, HLE, SWE-Bench Pro, Terminal-Bench 2.0 등 다섯 벤치마크와 여섯 모델을 다루며 별도 사이버 평가도 포함된다. 공통 EEE 스키마로 실행 조건과 결과를 묶어 재현과 비교를 돕는다. 같은 모델도 토큰 예산이나 정답 피드백에 따라 점수가 달라지므로 공개 기록을 확인하는 것이 단일 순위보다 중요하다.
Tech로 돌아가기
Tech
영국 AISI, 모델 평가 결과와 실행 조건 공개 확대
점수만 비교하지 않고 추론 예산과 평가 절차를 함께 살펴야 모델 간 차이를 제대로 해석할 수 있습니다.