Real-SWE는 사용 허가를 받은 실제 기업의 비공개 코드와 업무로 코딩 에이전트를 평가했습니다. 과제당 8회 실행한 평균 해결률은 Fable 5.1이 38.8%, Astra가 33.8%였으며 분석한 10개 과제 중 6개는 해결률이 15% 미만이었습니다. 지시문 중앙값은 1,742자지만 참조 수정 파일은 11개로 짧은 요청 뒤 많은 업무 맥락이 숨어 있었습니다. 흔한 실패는 요구사항 누락이었고 작은 과제 집합과 하네스 차이 때문에 일반 모델 순위로 확대하기 어렵습니다.
Tech로 돌아가기
Tech
Real-SWE, 비공개 기업 코드에서 에이전트 평가
모델과 기본 하네스의 조합을 시험한 결과이므로 기업별 업무 규칙 검증을 별도로 설계해야 합니다.