HarnessTax가 7개 모델과 Claude Code, Codex CLI, Pi의 21개 조합을 비교했습니다. 두 벤치마크에서 각각 30개 과제를 세 번씩 실행한 결과 성공률이 비슷해도 비용은 최대 5배 차이 났고, 초기 맥락과 도구 정의가 비용에 영향을 줬습니다. 공개 과제의 학습 오염 가능성과 작은 표본은 한계입니다. Anthropic의 관련 장기 작업 문서는 세션 간 기록과 단계별 검증의 필요성을 보여 주므로, 간결한 실행 도구의 비용 효율과 장기 작업의 상태 관리 요구를 함께 평가해야 합니다.