노키아 연구진의 AnyJev는 공개 LLM에서 텍스트 생성 없이 선택지별 판단을 읽는 라이브러리다. L0는 선택지 순환과 사전확률 보정으로 편향을 줄이고, L1은 질문당 100500개 라벨로 신뢰도를 조정한다. Qwen3-8B의 BANKING77 300문항 평가에서 확률 보정 오차는 0.240에서 L1의 0.095로 줄었다. 저장소는 100300개 라벨의 L2 헤드도 제공하지만 모델과 질문별 검증이 필요하다고 밝힌다. 보도와 달리 현재 실행 백엔드는 transformers이며 vLLM과 SGLang은 로드맵이다. 작은 표본의 성능을 모든 실무에 일반화할 수는 없다.
Tech로 돌아가기
Tech
AnyJev, 공개 LLM의 선택 편향과 확률 보정 지원
무라벨 방식과 학습 예제가 필요한 보정을 구분하고 저장소의 실제 백엔드 지원 범위를 확인해야 합니다.