Full Story · 에이전트코리아

MinerU 4.0·PP-OCRv6 공개 소식 — Paddle 사용 관찰과 표·특허 도면의 남은 과제

🕐 2026-09-25에이전트코리아
본 기사는 여러 오픈카톡방 대화를 완전 익명(발화자 식별 정보 전면 제거) 처리해 병합한 것입니다.

표와 특허 도면 인식 문제 — OCR 경쟁 이후의 과제


25일 자정 무렵엔 MinerU 4.0과 PP-OCRv6 공개 소식을 계기로 공개 모델의 성능과 문서 구조 인식의 한계를 둘러싼 대화가 이어졌다.

한 참여자가 MinerU 4.0.0과 PP-OCRv6 공개 소식을 올렸다. 무엇보다 주목할 점은 성능 평가였다. 참여자는 ppOCR v6의 성능이 GPT 5.5보다 높다고 평가했다. 다만 비교에 쓴 문서나 평가 지표, 실행 조건은 대화에 제시되지 않았다. 모델 크기도 35M으로만 언급돼 단위를 확인할 수 없었다. 이 발언은 참여자의 평가로, 독립 검증된 성능 우위나 OCR 기술 전반의 변화를 확인한 결과로 보기는 어렵다.

그 참여자는 MinerU 4.0 버전을 열어 보니 내부에서 Paddle 모델을 쓰고 있다고 전했다.

4.0 까보니까 안에 paddle 모델 쓰고있네

참여자는 이를 의미 있게 해석했다. Paddle과 MinerU를 함께 쓰느냐, Paddle 파이프라인을 쓰느냐의 차이로 보면 될 것 같다는 의견이었다. 두 계열이 한 도구 안에서 만났다는 관찰에 따른 해석으로, 시장 전체의 경쟁 구도가 정리됐음을 입증하는 근거는 대화에 제시되지 않았다.

참여자는 처리 방식에 따른 단점도 설명했다. Paddle·MinerU 계열은 이미지를 잘라 해상도를 지키는 대신 느리고, 딥시크(DeepSeek) 계열은 토큰을 압축하면서 해상도를 일부 포기하는 면이 있다는 설명이었다.

그래서 딥시크 계열이 표쪽이나 폰트가 작은 쪽에서는 약한 단점이 있지요

참여자는 딥시크 계열이 빠른 대신 작은 글씨나 표 인식에 약점이 있다고 본 것이다. 표 안에 표가 들어가는 경우와 표의 수치를 화학식으로 읽는 경우도 대화에서 문제로 거론됐다.

더 근본적인 문제를 제기한 건 또 다른 참여자였다. 특허 도면 구조화의 난제를 지적했다.

특허는 XML로 되어 있는데.. 도면의 연결관계를 OCR로는 해결이 안되요

특허 도면에서 도면 번호끼리의 연결 관계를 문자로 인식하는 것만으로는 충분하지 않다는 뜻이다. 참여자는 아이디어의 여러 경우의 수를 고려해 구조화하고 권리로 정리하는 어려움도 설명했다. 한 참여자가 덧붙인 말도 이 한계를 드러냈다.

AI는 적당히는 잘해주는데… 알아서 하라고 하면 일정 수준으로 넘어가지를 못해요.. 그러고 명확하지 않아요.

MinerU와 PP-OCRv6에 대한 참여자의 평가에 이어, 대화는 표와 특허 도면의 구조를 읽는 어려움으로 이어졌다. 표의 수치를 구분하고 도면의 연결 관계를 파악하는 문제는 문자 인식 성능과 함께 살펴야 할 과제로 거론됐다. 이번 대화는 공개 모델에 대한 기대와 문서 구조화의 어려움이 함께 제기된 사례로 보인다.