IBM Research가 ALTK-Evolve에서 에이전트의 반복 실행 일관성을 진단하고 지침을 개선하는 방식을 소개했습니다. AppWorld 168개 작업에서 GPT-4.1 기반 에이전트의 평균 성공률은 77.4%였지만 다섯 번 모두 성공한 비율은 53%였습니다. 의사결정 지점을 다시 샘플링해 지침을 적용한 뒤 두 수치는 각각 81%와 69%가 됐습니다. 여기서 69%는 다섯 번 중 한 번 성공하는 지표가 아닙니다. 특정 벤치마크 결과이므로 실제 업무에서는 비용과 실패 유형 및 반복 성공률을 함께 재평가해야 합니다.