Jev의 후속 평가에서 Every는 글 37개에 대한 판단 777건을 0.7초 안에 처리했지만 별도 결함 검사에서는 7개 중 6개만 찾았습니다. 약 1만6000회 호출한 다른 평가는 공개 분류 4종 중 3종에서 소형 GPT보다 높은 정확도와 556배 낮은 비용을 보고했고, 문서 업무 5회 재실행에서는 결과를 유지하며 라우팅 호출을 5067% 줄였습니다. 반면 긴 문서와 이메일 요청 판단에는 확신한 오답도 있었습니다. 별도 분석은 일반 Qwen의 단일 토큰 선택만으로도 2~3배 가속할 수 있음을 보여 줬습니다. 개발사 가이드는 코드가 제어 흐름을 맡고 모델을 검색, 라우팅과 의미 검사에 쓰도록 제안하며 숫자 계산의 약점도 인정합니다. 속도 수치는 조건이 서로 다르므로 실제 업무 데이터로 임계값과 누락률을 검증해야 합니다.