Gemini 4 발표 뒤 일부 내부 관계자들이 코딩의 일관성과 프런트엔드 작업 품질에 의문을 제기했다고 보도됐습니다. 높은 벤치마크 점수에 비해 완성도 높은 앱을 만드는 실제 업무에서는 성능 편차가 있다는 주장입니다. 구글은 코딩 성능이 떨어진다는 평가에 동의하지 않았고 내부에서도 경쟁력을 높게 보는 의견이 전해졌습니다. 이는 출시 자체와 구분되는 후속 평가 논쟁이지만 동일 조건의 공개 재현 실험은 아닙니다. 제한된 이용 범위에서 나온 평가를 전체 사용자 경험으로 일반화하지 않아야 합니다.