본문으로 건너뛰기
Kabkee.github.io
뒤로 가기

Laya로 Jev를 무료로 대체할 수 있을까? 한국어 데이터로 Laya·Jev·Kev·JEV-9B 직접 비교해봤다

2026년 10월 3~4일, 하루 동안 직접 테스트한 기록이다. 정확도는 내가 가진 한국어 데이터 기준이고, 모든 모델을 별도 학습 없이 받은 그대로 돌린 결과다. 데이터와 과제가 다르면 결과도 달라질 수 있다.

목차

목차 펼치기

요약

왜 이 테스트를 했나

나는 360° VR로 장소를 둘러보는 서비스를 운영하고 있다. 이 서비스의 검색창에 이런 기능을 붙이고 싶었다.

이걸 하려면 검색어와 콘텐츠를 «카테고리」로 판단해 주는 무언가가 필요하다. 매번 ChatGPT 같은 LLM을 부르면 느리고, 사용량만큼 비용이 계속 나간다.

그러던 중 유튜브에서 Laya를 봤다. «유료 Jev 대신 Laya를 쓰면 무료로, 무제한으로 쓸 수 있다»는 내용이 많았고, GitHub 별이 3만 개가 넘을 만큼 화제였다. 실서비스에 조금이라도 도움이 되면서 무료로 붙일 수 있다면 더없이 좋은 기회라고 생각했다. 그래서 정말 그런지 내 데이터로 직접 확인해 보기로 했다.

결정 모델이란

ChatGPT 같은 LLM이 글을 «생성»한다면, 결정 모델은 정해진 형식의 질문에 답과 확률을 한 번의 계산으로 돌려준다.

글을 길게 생성하지 않아서 빠르고 싸다. 그리고 확률이 같이 나오는 것이 핵심이다. 확률이 높은 답은 자동으로 쓰고, 낮은 답은 쓰지 않거나 사람이 보게 하는 구조를 만들 수 있다. 그래서 확률을 믿을 수 있는지가 정확도만큼 중요하다.

비교한 모델

모델만든 곳형태크기비용인기도 (2026-10-03)
Jev (jev-1.13)TypeSafe AI클라우드 API비공개유료. 무료판 jev-1.13-free 는 기간 한정-
Laya오픈소스로컬 (ModernBERT 인코더)421M무료 (Apache 2.0)GitHub ⭐ 약 3.0만
Kev-4B오픈소스 (jaredpalmer)로컬 (Qwen3.5-4B + LoRA)4B무료GitHub ⭐ 약 8.4천
JEV-9Bautotrust로컬 (Qwen3.5-9B + Jev 증류 어댑터)9B, 원본 약 18GB무료HF 다운로드 약 1.2만
Tev1-4BTogether AI로컬 (Ollama)4B무료GitHub ⭐ 약 200

테스트 환경과 방법

항목내용
로컬 모델 실행집에 있는 데스크톱 PC. RTX 3060 12GB, RAM 32GB, Windows(WSL)
호출다른 컴퓨터에서 VPN(tailscale)으로 API 호출
Jev클라우드 API (jev-1.13-free)
데이터내가 운영하는 서비스의 한국어 장소 콘텐츠 300건 (무작위 추출, 모든 모델에 같은 300건)
과제제목·태그·설명을 보고 대분류 31개 중 하나 고르기
정답서비스에서 이미 쓰고 있는 분류값
학습없음. 모든 모델을 받은 그대로 사용

대분류마다 하위 분류 이름을 설명으로 붙였다(예: «학교: 초등학교, 중학교, 고등학교, 대학교…»). 질문 방식은 두 가지를 썼다.

결과 1: 정확도와 속도

모델 · 질문 방식정확도한 건 응답 시간 (중간값)GPU 메모리
Laya, 1단계41.0%28ms약 1.7GB
Laya, 2단계38.7%48ms약 1.7GB
Jev, 1단계 (설명 8개)73.7%802ms클라우드
Jev, 1단계73.3%764ms클라우드
Kev-4B, 1단계74.7%3,876ms약 11.7GB
Kev-4B, 2단계73.0%1,921ms약 11.7GB
JEV-9B 4bit, 2단계70.3%508ms7.6GB
JEV-9B 8bit, 2단계72.3%584ms10.4GB

처음 측정할 때는 내 실수가 있었다. 선택지 설명을 앞에서 8개까지만 넣는 바람에 «학교» 설명에서 «대학교»가 잘려 나갔다. 이때 Kev-4B 1단계는 68.3%였는데, 설명을 전부 넣자 74.7%로 올랐다. 2단계는 더 심해서 48.0%까지 떨어졌다가 73.0%로 회복했다. 로컬 결정 모델은 선택지 설명을 얼마나 잘 써 주느냐에 따라 결과가 크게 달라진다.

반면 Jev는 설명을 8개만 줬을 때(73.7%)와 전부 줬을 때(73.3%)가 거의 같았다. 설명이 부족해도 스스로 잘 메우는 쪽이다.

결과 2: 확신도를 믿을 수 있는가

실서비스에서는 «확신이 높은 답만 자동으로 쓰고 나머지는 쓰지 않는다»가 기본이다. 그래서 확신도별 정확도를 따로 봤다.

모델 · 질문 방식확신 80% 이상 답의 정확도 (그런 답의 비율)확신 90% 이상 답의 정확도 (그런 답의 비율)
Laya, 1단계49.4% (55%)51.5% (45%)
Laya, 2단계60.9% (46%)60.2% (28%)
Jev, 1단계 (설명 8개)81.3% (73%)82.4% (51%)
Jev, 1단계83.3% (84%)85.0% (78%)
Kev-4B, 1단계95.5% (44%)99.0% (32%)
Kev-4B, 2단계95.1% (48%)95.4% (22%)
JEV-9B 4bit, 2단계85.9% (66%)91.1% (52%)
JEV-9B 8bit, 2단계86.8% (68%)88.2% (56%)

모델마다 확신을 주는 «성격»이 달라서, 같은 80%라도 의미가 다르다. 그래서 각 모델이 가장 확신한 답을 같은 비율만큼 잘라서 다시 비교했다.

가장 확신한 상위Kev-4B 1단계Kev-4B 2단계JEV-9B 8bitJev
20%98%95%95%88%
30%99%96%96%89%
50%94%94%93%93%
70%87%88%87%89%

결과 3: Jev와 얼마나 같은 답을 내나

«Jev 대신 쓸 수 있나»를 보려고, 각 모델이 Jev와 같은 답을 고른 비율도 쟀다.

모델 · 질문 방식Jev와 같은 답
Laya, 1단계40.7%
Laya, 2단계44.0%
Kev-4B, 2단계85.3%
JEV-9B 4bit, 2단계85.7%
Kev-4B, 1단계87.7%
JEV-9B 8bit, 2단계88.0%

위 표는 Jev «설명 8개» 측정과 비교한 값이다. 설명을 전부 준 Jev와 비교하면 JEV-9B 8bit 90.0%, Kev-4B 1단계 88.7%, Kev-4B 2단계 86.3%로 순서는 같았다.

Jev를 흉내 내도록 학습한 JEV-9B와, 그런 학습을 하지 않은 Kev-4B가 Jev와 비슷한 정도로 같은 답을 냈다.

Jev: 싸지만 유료, 무료는 언제까지일지 모른다

구분내용
유료 jev-1.13입력 100만 토큰당 약 $0.042, 출력은 무료 (공개 가격 기준)
무료 jev-1.13-freeOpenCode Zen에서 기간 한정으로 제공. 종료일은 공개되지 않았다
실제로 막힌 한도내 계정에서는 하루 약 317번 호출한 뒤 429(요청 한도 초과)로 막혔다
응답 시간한 건에 약 0.8초 (인터넷 경유)

정확도만 보면 Jev는 훌륭하다. 하지만 하루 317번으로는 검색창 같은 서비스 기능을 감당할 수 없고, 무료판은 언제 끝날지 모른다. 서비스에 넣는다면 결국 유료로 넘어가야 한다.

9B 모델은 내 GPU에서 돌아갈까: 양자화 실측

JEV-9B 원본은 약 18GB라 RTX 3060(12GB)에 그대로는 들어가지 않는다. 그래서 모델을 줄여서(양자화) 올려 봤다.

방법GPU 메모리RTX 3060에서정확도응답 시간
원본 (bf16)약 18GB안 들어간다측정 못 함-
8bit 양자화10.4GB들어간다72.3%584ms
4bit 양자화7.6GB들어간다70.3%508ms

원본이나 두 모델을 함께 돌리려면

12GB GPU에는 한 번에 한 모델만 올릴 수 있다. Kev-4B(약 11.7GB)와 JEV-9B 8bit(10.4GB)를 같이 쓰거나 JEV-9B 원본을 쓰려면 더 큰 메모리가 필요하다.

방법메모리대략적인 비용메모
RTX 3090 중고24GB약 100~180만 원 (그래픽카드만)일반 PC 조립으로 가능한 가장 싼 방법. 전력 소모가 커서 파워 용량을 확인해야 한다
RTX 4090 중고24GB약 360~400만 원3090보다 빠르다
RTX 509032GB중고 거래가 약 770~880만 원대가 많다원본 9B와 4B를 함께 올릴 여유가 있다
Mac mini (M4 Pro)48GB / 64GB 통합 메모리약 269만 원 / 약 299만 원 (출시 공식가 기준)조립 없이 살 수 있다. 결정 모델이 Mac에서 얼마나 빠른지는 직접 재보지 않았다

그래서 검색 추천에 어떻게 쓰기로 했나

가장 정확하고 무료인 것은 Kev-4B였다. 하지만 한 건에 2~4초가 걸려서, 사용자가 글자를 칠 때마다 답해야 하는 검색창에 바로 부를 수는 없다. JEV-9B 8bit도 0.6초라 자동완성에는 느리다.

그래서 실시간으로 묻지 않고, 하루 한 번 밤에 미리 계산해 두는 캐시 방식을 택했다.

밤에 미리 계산해 두는 것

[매일 밤, Kev-4B 1단계로 일괄 계산]
  ① 콘텐츠마다 카테고리를 미리 붙여 둔다 (콘텐츠 수만큼)
  ② 자주 들어오는 검색어마다 «무엇을 찾는 검색인지»(의도)를 미리 계산해 둔다
  ③ 확신 90% 이상인 답만 저장한다 → 저장된 답은 약 99%가 정답

검색할 때 추천 목록 순서에 반영하는 방법

«부산 바다 카페»를 검색했다고 해 보자.

① 검색어 의도 조회 (캐시, 약 1ms)
     "부산 바다 카페" → 카페 (확신 0.97)
② 지역은 사전으로 뽑는다
     "부산" → 부산광역시   ← 지역명은 문자열로 정확히 뽑을 수 있어서 모델을 쓰지 않는다
③ 기존 검색으로 후보를 뽑는다
     키워드 + 지역 필터로 상위 30개
④ 순서를 다시 매긴다
     후보 중 카테고리가 «카페»로 분류된 콘텐츠에 가산점 → 위로 올린다
⑤ 추천 목록에 보여 준다

모든 검색어를 미리 준비해야 하지 않나?

그렇지 않다. 검색어는 소수가 대부분을 차지했다. 테스트 서버의 검색 기록을 세어 보니 이랬다.

상위 검색어전체 검색 중 비율
10개53.0%
100개89.4%
300개97.9%

인기 검색어 수백 개만 매일 밤 계산해 두면 대부분의 검색이 캐시로 처리된다. 그리고 모델 서버가 꺼져 있어도 저장해 둔 결과로 검색은 그대로 동작한다.

이런 곳에도 쓸 수 있다

어느 경우든 핵심은 같다. 실시간이 꼭 필요하지 않다면 밤에 미리 계산하고, 확신이 높은 답만 쓴다. 그러면 무료 로컬 모델로도 충분히 서비스에 붙일 수 있다.

정리: 누구에게 무엇이 맞을까

상황추천
영어 위주, 속도가 최우선, 틀려도 괜찮은 보조 판단Laya
정확도가 중요하고 사용량이 적다Jev 무료판 (끝날 때를 대비한 유료 전환 준비)
정확도가 중요하고 미리 계산해 둘 수 있다, GPU 12GBKev-4B + 하루 한 번 캐시
1초 이내로 빠른 판정이 필요하다, GPU 12GBJEV-9B 8bit
실시간으로 Jev급 정확도가 필요하다24GB 이상 GPU를 준비하거나 유료 Jev

«무료로 무제한»이라는 말은 맞다. 하지만 무료인 것과 쓸 만한 것은 다르다. 내 한국어 데이터에서 Laya는 정확도도, 확신도도 실서비스에 쓰기 어려웠다. 대신 덜 유명한 Kev-4B가 유료 Jev와 같은 수준을 보여 줬다. 로컬 모델을 고를 때는 화제성보다 내 데이터로 300건만이라도 직접 재 보는 것을 추천한다.

한계

참고자료


이 글 공유하기:

이전 글
Node.js에서 PHP 세션 파싱하기: MySQL에 저장된 세션을 JavaScript 객체로