초고속 판단 모델 Jev(제브)의 자리는 추론이 아니라 판단 — 리랭킹·메일 분류엔 강하고 확률 수치엔 신중론
1홉 검색·리랭킹·메일 분류엔 강하고, 복잡한 추론과 확률 수치엔 신중하라는 정리
21일 오전, 한 참여자가 TypeSafe AI의 초고속·저가 판단 모델 Jev(제브, API 전용)의 성격을 한마디로 정리했다. 추론을 하는 모델이 아니라 단편 데이터를 판단하는 데이터 상하차 모델(단편 데이터를 빠르게 받아 판정해 넘기는 모델)이라는 것이다. 1홉(한 번만 찾아보면 되는 단순 조회) 수준 검색엔 좋지만 복잡한 추론에선 효율이 떨어진다는 진단이 따라붙었다. Jev를 어디에 쓸지를 두고 이날부터 사흘 내내 이야기가 이어졌고, 34명이 293건을 주고받았다.
1HOP정도의 데이터서치는 매우좋은데
리랭커 자리를 넘보다
다른 참여자는 깃허브에 공개된 사례를 소개했다. 가중치 선별을 Jev에 맡겨 생성 시간을 줄였다는 내용이다.
요약 : H3 가중치 선별을 라이브로 jev 맡겨서 생성을 6 분에서 3 분으로 줄임
이 참여자는 리랭킹을 Jev로 교체하면 동일 성능에 1초 미만이 나온다며, 리랭커 시장이 흔들린다고 봤다. 검색 결과의 순서를 다시 매기는 리랭킹은 짧은 판단을 거듭하는 일이라, 빠르고 싼 판단 모델이 먼저 들어갈 자리로 꼽힌 것으로 보인다.
믿어도 되는 숫자인가
21일 오후엔 신중론이 나왔다. 한 참여자는 "Jev 가 뱉어내는 확률적 수치가 과연 믿을만한가..? 로 봐야할텐데오.."라고 짚었다. 같은 날 오후엔 1만 달러로 시작한 모의 비트코인 롱숏(오르내림 양방향 모의 투자)을 Jev에 맡겨 본 보고도 올라왔다. 22일 새벽엔 한 참여자가 쓰임새를 더 좁혀, 객관식과 시스템1 사고, 곧 빠르게 고르는 판단에 맞는 모델이고 복잡한 이미지 분류는 멀티모달 모델 몫이라고 정리했다.
객관식 & System1적 사고
판단 칸에 끼우는 분업
실사용 후기도 쌓였다. 22일 밤엔 "개인메일 회사 메일 분류 다했어요"라는 후기가, 23일 오전엔 작업별 모델과 effort 설정을 Jev로 자동화한 사례가 있다는 언급이 나왔다. 파장은 쓰임새 논의에 그치지 않아, 21일 점심엔 Jev 이야기가 공부한 게 실시간으로 쓸모없어진다는 한탄으로 번졌고 주변에서 Jev를 이해하지 못하는 사람이 80%를 넘는다는 관찰에선 격차 우려가 나왔다.
직전 집계 기간(20일 낮~21일 새벽)에 JEV는 이 방에서 비교 대상으로 먼저 등장했다. 한 참여자가 API로만 쓸 수 있는 JEV와 견주도록 로컬에서 돌아가는 자체 검증 모델 ZTC와 비교 시험기를 허깅페이스에 잇달아 공개했고, 다른 참여자는 TypeSafe AI의 JEV 소개 글을 공유했다. 그 화제에 붙은 사람은 3명, 메시지는 15건이었다. 소수가 비교 시험하던 외부 모델이 사흘 만에 각자의 작업 흐름 어디에 끼울지를 따지는 논의로 번진 흐름이다.
논의는 성능 순위보다 작업 흐름의 어느 칸에 Jev를 넣을지를 먼저 묻는 쪽으로 모였다. 복잡한 추론은 큰 모델에, 짧고 반복되는 판단은 빠른 모델에 나누는 분업 감각이 방 안에서 공유되고 있음을 시사한다. 다만 확률 수치를 둘러싼 신중론은, 판단을 빠르게 맡기는 만큼 그 판단을 검수할 자리도 함께 설계해야 한다는 뜻으로 읽힌다.