JEV는 판단 기준 하나씩 Y/N으로 붙인다 — 2홉 추론은 약하고 로컬엔 불가 판정
JEV는 잘게 쪼갠 판단 하나에 예·아니오로 답하게 할 때 가장 낫다는 낮 문답
추석 당일 오전 10시 53분, 한 참여자가 방에서 자주 들리는 「JEV를 붙인다」는 말이 정확히 무슨 뜻인지 물었다. 실제 typesafe jev를 쓰는 것인지, 비슷한 무언가를 쓰는 것인지였다. 이 질문을 시작으로 JEV를 어디에, 어떤 방식으로 붙이는지를 두고 긴 문답이 이어졌다.
이 방에서 Jev를 붙인다는 말들을 많이 하시는데 실제 typesafe jev를 사용하신다는 말일까요? 아니면 jev와 유사한 거를 사용한다는 말일까요?
답은 「단독이 아니라 섞어 쓴다」였다. 참여자들은 JEV를 다른 모델과 함께 쓴다고 답했다. 한 참여자는 JEV를 알고리즘 자체가 아니라, 알고리즘을 만들기 전에 구현 가능성을 초저가로 시험해 보는 수단이라고 설명했다. 300번 넘게 쓰였는데 아직 만 원도 못 썼다는 비용 경험도 함께 내놨다.
사내 로컬 적용을 검토하던 질문자에게는 신중론이 돌아왔다. 직접 구현해 보니 할루시네이션이 심해 정확도가 70 ~ 80에 그쳤다는 경험담이었고, 결론은 짧았다.
로컬나와도 불가판정내렸어요
그렇다면 어떤 일에 붙이나. 다른 참여자는 품질 검사(QC) 방식을 세 단계로 비교했다. 정규식(Regex)은 너무 엄격하고, 시맨틱 유사도 기반은 너무 모호해지며, 판단 기준을 하나씩만 맡겨 병렬로 돌리는 JEV식이 가장 낫다는 순서다. 출력 형태로는 float 점수보다 Y/N이나 Enum이 가장 좋다고 정리했다.
QC에서 Regex (너무 strict) < 시맨틱 유사도 기반 포함 (너무 모호해짐) < jev 식 (판단 기준 1 개씩만 맡겨서 병렬) 이렇게만 보는 중입니다
세 방식의 차이는 기준의 폭에 있다. 정규식은 정해 둔 글자 모양에서 조금만 벗어나도 틀렸다고 보고, 유사도 방식은 비슷하면 통과시키다 보니 경계가 흐려진다. JEV식은 판단 기준을 하나로 좁혀 맡겨 두 문제를 피하는 셈이다.
이 정리에는 "생각이 일치하는구만"이라는 맞장구가 돌아왔다. 두 참여자는 여러 단계를 거쳐 이어지는 2홉(hop) 이상 추론에서는 아직 약하다는 데도 뜻을 같이했다. 한 참여자는 "저런 소형 일반 케이스에서는 유즈케이스가 좋어요"라고 쓰임새의 범위를 짚었다.
이 문답은 JEV를 「무엇이든 판단하는 모델」보다 「잘게 쪼갠 질문 하나에 예·아니오로 답하는 부품」으로 보는 시각을 보여 준다. 판단을 한 기준씩 나누고 출력은 Y/N·Enum으로 좁히는 쪽이 낫고, 판단이 여러 단계로 이어지면 다시 약해진다는 관찰이 같은 방향으로 모였다. 로컬 구현에서 정확도 70 ~ 80에 그쳐 불가 판정이 나온 경험까지 더하면, 쓰임새는 아직 좁은 판단 하나에 한정된다는 시각으로 보인다. Y/N·Enum처럼 답의 선택지를 미리 정해 두는 출력이 선호된 것도 같은 맥락으로 보인다.