Claude Code와 Codex를 ProgramBench 200개와 별도 18개 과제로 평가한 결과, Claude의 시간 추정은 실제보다 평균 3배, Codex는 6~10배 어긋났습니다. 같은 모델도 하네스에 따라 단계 수가 평균 2.5배 달랐고, 자기 성과는 실제보다 평균 20점 높게 평가했습니다. 장시간 작업의 일정과 완료 판정을 에이전트 자기보고에 맡기기 어렵다는 뜻입니다.
Tech로 돌아가기
Tech
Claude Code와 Codex는 작업 시간과 자기 성과를 크게 오판했습니다
에이전트 운영에는 모델의 시간 예측보다 외부 타이머, 객관적 테스트와 하네스별 실행 한도를 기준으로 삼아야 합니다.
출처
- AI agents have no sense of time and are not aware of it — The Decoder