Google이 앱 신규 작성과 대규모 리팩터링, 플랫폼 이전 등 장기 과제를 평가하는 Android Bench 2.0을 공개했습니다. 기능과 화면 충실도, 회귀를 연속 점수로 측정하고 비용 및 모델 제공자의 에이전트 조합도 제시합니다. 장기 과제 최고 통과율은 GPT-6 Astra의 약 28%로 기존 과제의 약 91%보다 낮지만 평가 대상이 달라 성능 퇴보를 뜻하지 않습니다. 익숙한 코드 변환보다 런타임 검증과 구조 변경이 어려워, 실제 맡길 업무와 유사한 항목을 봐야 합니다.