혹평으로 열린 GPT-5.6 첫날 밤, 새벽 '가성비 만장일치'로 뒤집혔다
GPT-5.6 출시 첫날 밤, 세 커뮤니티가 각자의 방식으로 새 모델을 검증했다. 초저녁 혹평이 새벽 재평가로 뒤집히는 동안, 평가 방식 자체가 모델끼리 교차 검증하는 쪽으로 옮겨간 정황이 보인다.
금요일 저녁, GPT-5.6을 처음 만져본 한 커뮤니티의 첫 반응은 시큰둥했다. "똑똑은 모르겠고 일단 느린거같아요"라는 말이 나왔고, 곧이어 비슷한 톤의 평가가 뒤따랐다.
"codex로 코딩하는 것도 5.5랑 차이 안나는 느낌인데요"
출시 당일의 흥분이 가라앉은 자리에서, 세 커뮤니티는 밤새 같은 질문을 붙들었다. 새 모델이 정말 나아졌는가. 답을 내는 방식은 방마다 달랐지만, 밤이 깊어질수록 저울은 한쪽으로 기울었다.
새벽에 뒤집힌 저울
가장 극적인 반전은 혹평이 나왔던 바로 그 방에서 나왔다. 초저녁 "5.5랑 차이 없다"던 분위기는 새벽 3시를 넘기며 정반대로 바뀌었다.
"GPT 5.6 생각보다 가성비 미쳤음 : 만장일치"
저녁의 첫인상과 새벽의 결론이 갈린 셈인데, 그 사이에 있었던 것은 몇 시간의 실사용이었다. 첫날 밤의 모델 평가가 발표 스펙이 아니라 밤샘 작업의 체감으로 결정되는 흐름을 보여주는 대목으로 읽힌다.
평가 도구가 된 다른 모델들
다른 방에서는 새 모델을 사람이 직접 평가하는 대신, 모델끼리 서로 검증하게 하는 장면이 이어졌다. 한 참여자는 클로드(페이블)와 킴, 솔이 서로의 작업을 번갈아 반려하는 과정을 실시간으로 중계했다.
"페이블 < KIMI가 태클 < 이걸 SOL이 태클 < 이걸 페이블이 태글"
이 촌극은 끝내 API 에러로 마무리됐지만, 7시간 가까이 혼자 검증하고 수정하는 자율 작업 사례와 새벽의 페이블 설계-그록 작업-솔 리뷰 파이프라인 운용기까지 겹쳐 보면, 새 모델 등장이 곧 기존 모델들과의 조합 실험으로 이어지는 패턴이 자리 잡은 것으로 보인다.
세 번째 방의 밤샘 논쟁도 같은 축 위에 있었다. 클로드 계열과 코덱스를 오가며 장단점을 견주던 한 참여자는 막혔던 작업이 풀린 순간을 이렇게 남겼다.
"1시간 붙들던게 페이블하니까 왜 한번에 해결되는지 한허들은 넘었는데"
HTML은 클로드가 앞선다는 평가와 알아서 척척 해내는 코덱스 예찬이 맞서는 동안, 어느 한쪽의 승리 선언은 나오지 않았다.
왜 세 방이 같은 밤을 새웠나
세 커뮤니티가 동시에 이 주제에 몰린 배경에는 GPT-5.6 출시라는 공통 사건이 있다. 다만 대화의 무게중심은 "새 모델이 좋은가"에서 "내 작업 조합에 어디를 맡길 것인가"로 옮겨가 있었다. 단독 사용 소감보다 모델 간 교차 검증과 역할 분담 실험이 첫날 밤의 주된 검증 방식이 된 점은, 멀티모델 운용이 이 커뮤니티들의 기본 작업 방식으로 스며들고 있음을 시사한다.