한국어 문서 OCR 모델이 오픈웨이트로 풀렸다 — 같은 공개 글, 대화가 이어진 곳은 에이전트코리아뿐
한국어 문서 OCR 오픈웨이트 공개 글이 두 방에 올라간 뒤 에이전트코리아에서만 이어진 대화
낮 두 시 무렵 한국어 문서 OCR(이미지 속 글자를 읽어 내는 기술) 모델 소식이 두 방에 거의 동시에 올라왔다. 한 스타트업 대표가 schift-ocr-1-beta를 MIT 라이선스 오픈웨이트(학습된 모델을 내려받아 쓸 수 있게 공개하는 방식)로 공개했다는 글이다. 같은 글이 에이전트코리아에는 14시 1분 24초, 공공AX 네트워크에는 14시 1분 39초에 똑같이 게시됐다. 글 본문에는 은행·금융 양식 인식 오류율 0.067이 MinerU(0.091), Gemini(0.152), Meta Muse Spark(0.159)보다 낮다는 비교가 들어 있었다. 이 수치는 공개한 본인이 글에서 밝힌 자체 측정값이다.
한국어 문서 OCR 모델 schift-ocr-1-beta를 오픈웨이트로 공개했습니다.
에이전트코리아: 구조와 속도를 묻고, 써 본 인상을 남겼다
공개 직후 한 참가자가 "MOE 방식인가요 dense 모델이 아니라 ?"라고 물었고, 공개한 대표는 "MoE입니다!"라고 답했다. 그에 앞서 "4B 모델이지만 실제 계산량은 1B입니다 ㅎㅎ"라는 설명도 붙었다. MoE는 여러 전문가 부분 중 일부만 골라 계산하는 구조다. 다른 참가자가 계산량이 1B급이면 동시 요청을 많이 처리할 수 있겠다고 하자, 대표가 속도를 밝혔다.
시간당 15000장도 돌아갑니다
이 발화 바로 앞에 대표는 "H200에서 각잡고 돌리면"이라는 조건을 먼저 달았다. 즉 이 수치는 H200이라는 고성능 GPU에서 작정하고 돌렸을 때의 값이고, 일반 환경의 처리량이 아니다. 뒤이어 대표는 "거진 초당 5장씩 돌아가던것 같더군요"라고 덧붙였다. 이 방에서 이어진 것은 이 속도에 대한 감탄과 운영 비용 계산이었다. 한 참가자는 "성능도좋은데 매우매우 빠르네용"이라고 적었고, 곧 "엥간한 중견기업에서도 사용하는데 문제없을듯요"라고 이었다. 같은 참가자는 H200을 예약형으로 빌려 하루 12시간씩 돌려도 10만원이 안 나올 것 같다고 어림했고, 전기료를 묻는 질문에는 "7만원쯤 나오려나"라고 답했다. 다만 이들이 실제 문서로 돌려 본 검증 후기라고 확인되는 발화는 없다. 앞서 다른 참가자가 "맛볼께요"라고 남긴 것 정도가 착수 의사로 읽힌다.
kordoc과의 비교는 공개한 대표 본인의 벤치였다
저녁 무렵 화제는 파싱 도구 kordoc으로 넘어갔다. 공개한 대표가 직접 "kordoc 이번에 올라온거 보고"라며 "돌려봤습니다"라고 밝히고, 결과를 이렇게 요약했다.
요약 ; Kordoc은 벤치에서 아직 못이겼다..!
이어 "docling mineru 다 가뿐히 이깁니다"라고 했다. 이어진 발화 "저거 언젠가 이기고본다"와 "근데 제껀 손필기도 이제 가능하니"를 함께 보면, 자기 모델이 kordoc을 벤치에서 아직 넘지 못했지만 docling과 mineru는 앞선다는 뜻으로 읽힌다. 이 벤치 역시 공개한 쪽이 돌린 결과이며, 독립적으로 재현된 사례는 이날 대화에 없다.
조금 앞선 16시 13분에 다른 참가자는 kordoc이 업데이트된 뒤 "엄청 대박"이라고 했다. 17시 무렵에는 대기환경 분야에서 일하는 참가자가 hwp 문서를 kordoc으로 분석한 경험을 길게 남겼다. 처음에는 "덕분에 이제 이런 hwp도 잘 읽습니다."라며 "저런게 수천페이지 있었거든요..."라고 했고, 이어 "현재까지 코닥으로 분석시 실패율 0...."이라고 보고했다. 다른 참가자가 배출시설-방지시설 계통도에 저런 연결 선이 많겠다며 인허가 업무를 하시느냐고 묻자 "네네"라고 답했다. 또 하나 눈에 띄는 대목은 "인간지능으로 만들어 놓은 오기 30여개 찾았습니다"라는 말이다. 사람이 손으로 만든 문서의 오류를 도구가 찾아냈다는 뜻이다. 실패율 0은 개인 관측이지만, 이번에는 대상이 수천 페이지의 계통도이고 오기를 30여 곳 짚어 냈다는 구체적인 설명이 곁들여졌다. 그 분석 결과로 온톨로지 구현이 가능한지도 물었으나, 이에 대한 답은 대화에서 확인되지 않는다.
공공AX 네트워크: 같은 글이 올라갔지만 반응은 이어지지 않았다
공공AX 네트워크에서는 사정이 달랐다. 앞의 공개 글이 올라온 바로 다음 발화는 9분 뒤인 14시 10분 22초의 지방의회법 공청회 소식이었고, 이 모델에 대한 질문이나 감상은 붙지 않았다. 0.067이라는 오류율도 이 방에서 따로 논의된 것이 아니라, 에이전트코리아와 똑같은 글 본문에 들어 있던 수치일 뿐이다.
같은 날 이 방에는 다른 도구 소식도 올라왔지만, 게시자와 시각이 모두 다른 개별 글이었다. 11시 20분에는 법조문 간 인용 관계를 보여 주는 앱에 보건·의료와 고용·노동 분야가 추가됐다는 글이, 15시 58분에는 Upstage가 OpenRouter에 "판단만 해주는 AI"를 출시했다는 글이 올라왔다. 이 셋을 하나의 흐름으로 묶어 읽을 근거는 없다.
kordoc이라는 이름은 이 방에서도 두 번 나왔지만 OCR 공개 글과는 이어지지 않는 별도 맥락이었다. 12시 55분에 한 참가자가 워크숍 자리에서 "낯익은 kordoc을 보여주시네요"라고 적었는데, 이는 공개 글이 올라오기 한 시간 이상 앞이다. 15시 26분에는 다른 참가자가 다음과 같이 적었다.
kordoc을 모르고 파서를 스스로 만들어 쓴 죄
이 발화는 직전에 오간 파견 공무원 관련 논의 뒤에 나온 것이라, OCR 소식에 대한 반응으로 볼 수는 없다.
확인되지 않은 것
정리하면 같은 공개 글이 두 방에 올라갔지만 모델을 두고 대화가 이어진 곳은 에이전트코리아뿐이었다. 오류율 0.067과 벤치 순위는 모두 공개한 쪽이 밝힌 값이고, 측정 조건과 표본은 나오지 않았다. 시간당 15000장은 H200 조건에서의 수치다. 이 모델을 실제 업무 문서로 돌려 검증했다는 후기는 확인되지 않았고, 대화에서 실사용 경험담으로 나온 것은 kordoc 쪽이었다. 공공AX 네트워크의 반응이 이 모델을 업무에 넣겠다는 결정으로 이어졌는지도 알 수 없다.