매연 감지 데이터가 모자라자 산불 연기 사진 5만 장을 끌어왔다
매연 감지 모델의 데이터 부족 문제를 AI가 스스로 산불 연기 사진 전이학습으로 풀어낸 사례와, 백본 동결이 만든 일반화 성능 향상을 정리했다.
밤 10시반, 대기환경 분야에서 일하는 것으로 보이는 한 참가자가 자신이 다루는 매연 감지 모델의 데이터 문제를 AI가 스스로 풀어낸 과정을 공유하며 대화가 시작됐다. "데이터셋 부족하니까 스스로 전이학습도 시키네요"라는 첫 언급 뒤에, 구체적으로 어떤 데이터를 끌어왔는지가 이어졌다. "산불 연기 데이터 5만장 끌어와서 학습시키더니"라는 설명이었다. 매연과 산불 연기는 카메라에 잡히는 시각적 특성(연기 형태, 확산 패턴)이 유사하다는 점에 착안해, 상대적으로 데이터가 풍부한 산불 연기 이미지를 대체 학습 자원으로 끌어온 것으로 보인다.
백본을 얼리고, 일부만 새로 학습시켰다
이 참가자는 학습 방식도 구체적으로 설명했다. "백본 일부 동결하고 알아서 조금 남은 데이터셋 전이학습시키더라고요... 중간중간 의사 결정하고 지침만 조금 주고"라는 언급이다. 모델 전체를 처음부터 다시 학습시키는 대신, 이미 학습된 특징 추출부(백본)의 일부는 그대로 얼려 고정하고, 나머지 일부만 새 데이터로 미세 조정하는 방식이다. 이 참가자는 학습 전후 결과를 직접 비교하며 개선 폭을 확인했다고 밝혔다. "2번째가 전이학습 전 기존 데이터로만 학습해서 추론한 결과고 3-4번째가 전이학습으로 에폭수 늘리면서 아스트라가 모델 개선한"라는 설명은, 단순한 체감이 아니라 학습 전·후 추론 결과를 나란히 대조해 성능 향상을 확인했다는 뜻이다.
왜 이 접근이 필요했나 — 좁은 데이터셋의 함정
이런 우회 학습법이 필요했던 배경에는 매연 데이터 자체의 근본적인 한계가 있었다. "사실 매연 데이터셋 자체가 적으니까 학습했던 대부분 유사한 배경들의 사진이라 일반화 성능에 대한게 엄청 고민이었거든요. 처음보는 개소의 매연을 탐지하는게 엄청 어려웠습니다"라는 토로였다. 데이터가 적다 보니 학습에 쓰인 배경 자체가 서로 비슷해, 한 번도 본 적 없는 새로운 장소의 매연은 제대로 잡아내지 못하는 문제가 있었다는 것이다. 이 문제를 산불 연기라는 인접 도메인의 대량 데이터로 보완한 결과는 기대 이상이었다. "생각보다 과적합도 안되고 동결 백본이 산불데이터 5만장으로 여러 배경을 보다보니까 과적합도 많이 줄고 일반화 성능이 엄청 올라가더라고요"라는 결과 보고에, 지켜보던 다른 참가자는 다른 건 몰라도 그 참가자가 대단한 것은 알겠다며 감탄을 표했다.
이 사례가 보여주는 것은, 특정 도메인의 데이터가 부족할 때 시각적으로 유사한 인접 도메인의 대량 데이터를 끌어와 전이학습시키고, 백본 일부를 동결해 과적합을 억제하는 접근이 실전에서도 통한다는 점이다. 참여 인원은 2명, 발화는 23건에 그쳤지만, 소수의 대화 안에 데이터 부족·전이학습·과적합 방지라는 컴퓨터비전 실무의 핵심 고민과 해법이 압축적으로 담긴 사례였다.