지연 1초 미만이라는 문턱, 행사장 실시간 번역 자막의 벽
행사용 실시간 번역 자막에서 지연 1초 미만 조건이 기성 서비스와 조합형 구성을 가르는 기준선으로 제시됐다.
저녁 7시를 갓 넘긴 시각, 한 참여자가 행사장에서 쓸 실시간 번역 자막 솔루션을 찾는다며 질문을 올렸다. 화자가 말하는 순간 그 발화를 번역해 곧바로 스크린에 자막으로 띄우는 구성이 목표였고, 후보군까지 이미 적어 온 상태였다. 인터프리파이(Interprefy)·워들리(Wordly)·이벤트캣(EventCAT) 정도가 시장에 나와 있는 선택지가 맞는지를 되묻는 형태였다.
"지금 화자가 말하는걸 실시간 번역해서 바로 실시간 자막 발생해주는게 .. Interprefy, Wordly, EventCAT 정도인가요?"
까다로운 쪽은 후보 목록이 아니라 조건이었다. 구글 클라우드 음성인식(Google Cloud Speech-to-Text)은 빨라도 2초가 걸려 지연이 너무 크고, 필요한 건 1초 미만이라는 것이었다. 자막이 화자의 입보다 두 박자 늦게 뜨면 청중은 이미 다음 문장을 듣고 있게 되므로, 이 숫자는 선호가 아니라 사용 가능 여부를 가르는 문턱으로 제시된 셈이다.
"지연율 1초 미만으로 ... 혹시 아시는 사스나 API 있으신분 추천좀 부탁드릴수 있을까요 ?"
돌아온 답은 완제품 서비스보다 조합 쪽으로 기울었다. 한 참여자는 chirp 후속으로 나온 제미니(Gemini) 모델과 번역용 Hunyuan을 후보로 들었고, 다른 참여자는 Gemini 3.5 flash lite 계열이면 속도가 나오지 않겠냐고 거들었다. 가장 눈에 띈 것은 파이프라인 자체를 줄이자는 제안이었다. 음성을 텍스트로 옮기고 그 텍스트를 다시 번역하는 두 단계를 밟는 대신, Audio-to-Text 단계에서 번역을 바로 박아 넣어야 한다는 것이다.
"Audio 2 Text 과정에서 바로 박는게 필요하져 아무래도"
시장 이야기도 함께 나왔다. 질문자는 한 달에 행사 20개는 잡을 수 있는 시장이라며 사업성을 짚었지만, 방의 반응은 조심스러웠다. 음성 인풋이 한국어와 영어 쌍방향으로 오간다는 조건이 붙자 참여자들이 난이도를 높게 봤기 때문이다. 한쪽 방향만 번역하는 구성이라면 모델 선택으로 풀 여지가 있지만, 두 언어가 섞여 들어오는 현장에서는 어느 언어인지 가리는 일까지 같은 지연 예산 안에 들어가야 한다는 점이 부담으로 읽혔다.
이 논의에서 흥미로운 대목은 질문과 답의 층위가 어긋난 자리다. 처음 질문은 "어떤 서비스를 쓰면 되나"였는데 오간 답은 대부분 "단계를 어떻게 줄이나"였다. 번역 품질이나 모델의 절대 성능이 아니라 파이프라인 단계 수가 그대로 지연으로 쌓이는 구조라는 인식이 방에 공유돼 있었고, 그래서 기성 서비스를 고르는 대신 직접 짜 맞추는 방향으로 논의가 기울었다는 해석이 가능하다.
정리하면 행사용 실시간 자막은 아직 사서 쓰는 물건보다 조립해 쓰는 물건에 가깝다는 인상을 남긴 대화였다. 1초 미만이라는 문턱이 기성 솔루션과 조합형 구성을 가르는 기준선으로 작동하고 있고, 그 문턱을 넘기 위해 단계 통합을 시도하는 흐름이 나타나고 있음을 시사한다. 다만 이날 방에서 실제로 1초 미만을 실측했다는 보고는 나오지 않아, 조합형 구성이 그 조건을 만족하는지는 확인되지 않은 채 남았다.