Full Story · 공공AX 네트워크

공공 데이터 구축, 온톨로지 요구 앞의 현장 난색

🕐 2026-10-07공공AX 네트워크
본 기사는 여러 오픈카톡방 대화를 완전 익명(발화자 식별 정보 전면 제거) 처리해 병합한 것입니다.

공공 AI 데이터 구축에서 메타데이터·청킹 정제와 온톨로지 도입 요구를 두고 오간 공공AX 방의 대화


화요일 밤 11시 45분, 공공AX 방에서 한 참가자가 걱정을 꺼냈다. 메타데이터를 외부망에서 구축하고 있는데, 이것을 내부 AI 구축으로 어떻게 끌고 올지가 제일 걱정이라는 말이었다. 이어 이 참가자는 데이터 구축을 더 중요하게 본다고 했다. 이날 7명이 이 주제로 대화를 나눴다. 외부망과 내부망이 나뉜 조건에서 만든 데이터를 어떻게 옮겨 올 것인가가 이 걱정의 요점으로 보이고, 이후의 정제 이야기는 모두 이 걱정 위에 얹혔다.

정제부터 구상한 설명

밤 11시 49분, 다른 참가자가 자신의 구상을 풀었다. HWP 문서의 레이아웃을 보존하는 파싱과 마크다운·JSON 구조화까지 데이터 정제를 생각했다는 것이다. 11시 50분에는 같은 참가자가 하이브리드 메타데이터 태깅을 고려해 부서별로 청킹하는 데까지 생각했다고 덧붙였다.

하이브리드 메타데이터 태깅 까지 고려해서 부서바이 부서로 청킹하는거까지 생각하기는 했어요

11시 53분 이 참가자는 구체적인 매핑 방식도 소개했다. 문서 생성 시점, 담당 부처, 보안 등급, 관련 법령을 메타데이터로 추출해 지식 그래프와 벡터 DB에 매핑한다고 했다. 이 설명은 그 참가자의 전언이며, 대화에서 실제 구축 여부나 성과가 확인된 것은 아니다. 눈여겨볼 것은 항목의 구성이다. 문서가 언제, 어느 부처에서, 어떤 보안 등급으로 만들어졌고 어떤 법령과 이어지는지를 먼저 붙여 두면 검색 단계에서 걸러 낼 근거가 생긴다는 발상으로 읽힌다.

온톨로지, 윗선은 원하고 현장은 난색

대화의 결은 바로 이 지점에서 바뀌었다. 앞서 걱정을 꺼낸 참가자가 11시 53분에 짧게 말을 보탰다.

온톨로지도 섞어야해요......

정제 절차를 소개한 참가자는 온톨로지는 절대 안 된다고 했다. 걱정을 꺼낸 참가자도 이게 제일 골치 아프다며 이걸 왜 해야 하느냐고 되물었고, 11시 54분에는 위에서 자꾸 말하는데 하기 싫어도 해야 한다고 하는 중이라고 털어놓았다. 두 사람 모두 온톨로지에 긍정적이지 않았다는 뜻이다. 갈린 것은 온톨로지의 필요 여부가 아니라, 윗선이 요구하는 일과 현장이 보는 부담 사이의 거리였다.

이 대화가 시사하는 것

이 대화에서 눈에 띄는 것은 양쪽이 모두 데이터 구축 쪽에 서 있고, 온톨로지에는 함께 난색을 보였다는 점이다. 질문은 AI를 쓸지 말지가 아니라, 쓸 수 있는 데이터를 어떤 층으로 만들어 둘 것인가로 옮겨 가 있다. HWP 문서의 레이아웃 보존 파싱이 정제 단계의 첫 항목으로 언급됐다.

수요일 새벽 0시 1분에는 처음 걱정을 꺼냈던 참가자가 A2A에 AI-DLC 방법론을 적용하면 정책 의사결정 보조 도구로 좋을 것 같다고 했다. 대화가 정제 방식에서 활용처로 한 걸음 넘어간 모습이다. 이날 새로 올라온 화두다.