OCR 모델 비교해보니…한글 손글씨·분수 인식은 여전히 숙제
OCR 모델 비교에서 한글 손글씨와 수학 공식 인식은 여전히 약점으로 꼽혔고, 매스픽스 등 전용 도구 조합이 대안으로 제시됐다.
문서 인식(OCR) 모델을 둘러싼 비교가 아침부터 이어졌다. 한 참여자가 "일반 OCR은 평이"하다고 운을 떼자, 다른 참여자가 "요즘 업스테이지는어떰?"이라고 물었다. 이어진 답은 미스트랄 쪽에 후한 평가를 실었다.
"미스트랄 압도적 장점 중 하나"
도장과 서명을 인식한다는 점("도장이랑 서명 인식함")이 그 이유로 꼽혔다. 표 인식 정확도는 다소 아쉽지만 처리 속도가 빠르다는 평가도 함께 나왔다.
대화는 곧 더 까다로운 영역으로 옮겨갔다. 한 참여자가 손글씨 문서 인식 경험을 이렇게 물었다.
질문 하나만 드려봅니다. 손글씨로된 한글, 수학 공식 등을 OCR 해보신 경험이 있으실까요? 클라우드 모델들로 해봤을 때는 영어는 곧잘 인식하는데 한국어와 특히 분수 쪽은 인식률이 처참한 편이라 고민이 많습니다 ㅜㅜ
답으로는 "손글씨는 vqa 모델들 추천드려요"라는 조언이 돌아왔다. 질문자는 이어 제미나이로 시도해본 경험도 전했다. "제미나이로 인식 시켜봤을 때는 서술형 답안의 오타나 틀린 답도 지가 멋대로 옳게 고쳐놓고 그래서 답답해서 여쭤봤습니다 ㅜㅜ LLM 특성상 어쩔 수 없는 것이겠죠...?"라는 토로였다 — 정답을 베끼는 게 아니라 스스로 판단해 '고쳐 쓰는' LLM 특유의 습성이, 원문을 있는 그대로 옮겨야 하는 손글씨 답안 채점 작업에서는 오히려 걸림돌이 된다는 뜻이다.
대안으로 나온 설명은 구조적이었다. 한 참여자는 "제미니는 vlm이라 latex코드 인식은 잘되지만, 수식을 latex코드로 불러내면서 오류를 만들어내는거고, 손글씨로된걸 latex코드로 변환하는 툴을 조합하면 될것같아요"라고 정리했다. 인식과 변환을 한 모델에 통째로 맡기지 말고, 손글씨를 LaTeX로 바꾸는 데 특화된 전용 도구를 앞단에 붙이는 조합이 대안으로 제시됐다. 유료 도구로는 매스픽스(Mathpix)가, 무료 대안으로는 Pix2Text·LaTeX-OCR·MinerU 같은 도구가 함께 거론됐다. 수식·분수처럼 구조가 복잡한 입력은 범용 모델 하나로 밀어붙이기보다, 인식과 변환 단계를 나눠 도구를 조합하는 편이 실무에서는 더 안정적이라는 이야기로 읽힌다.
업스테이지를 향한 평가도 이어졌다. 다른 참여자는 업스테이지를 두고 "표 쪽 정확도만 살짝 아쉽고" 나머지는 무난하다고 짚으며, 인식 정확도보다는 처리 속도 쪽에서 체감 차이를 느낀다는 의견을 보탰다. 도구 조합을 제안받은 질문자는 "앗 감사합니다! 한 번 적용해보겠습니다"라며 바로 시도해보겠다는 반응을 남겼다. 모델 하나에 정답을 통째로 맡기기보다, 인식과 변환을 나누고 상황에 맞는 도구를 골라 쓰는 편이 한글 손글씨·수식 인식의 현실적인 해법으로 자리 잡는 모습이다.