CLM은 상태와 후보 행동을 따로 벡터화해 적절한 선택지를 고르는 공개 모델입니다. Qwen3-8B 위의 작은 투영 계층을 학습하고 행동 벡터를 재사용해 반복 선택의 계산량을 줄입니다. 공개 저장소와 모델 카드는 최대 9배의 지연시간 개선을 보고하지만 조건에 따라 다릅니다. 코딩 점수는 다른 모델이 만든 여러 해답 중 미세조정한 검증기가 선택한 소규모 평가 결과이며, CLM 단독의 코드 생성 성능이나 전체 과제 성공률은 아닙니다.
Tech
캐시 기반 선택은 빠르지만 코딩 평가 수치는 다른 모델의 해답을 고른 결과입니다.
CLM은 상태와 후보 행동을 따로 벡터화해 적절한 선택지를 고르는 공개 모델입니다. Qwen3-8B 위의 작은 투영 계층을 학습하고 행동 벡터를 재사용해 반복 선택의 계산량을 줄입니다. 공개 저장소와 모델 카드는 최대 9배의 지연시간 개선을 보고하지만 조건에 따라 다릅니다. 코딩 점수는 다른 모델이 만든 여러 해답 중 미세조정한 검증기가 선택한 소규모 평가 결과이며, CLM 단독의 코드 생성 성능이나 전체 과제 성공률은 아닙니다.