사이트 수정은 GLM5.3플래시로, 가성비 1등은 swe-2 — 저가 코딩 모델 비교가 하루를 채웠다
벤치 점수와 실사용 후기가 갈린 저가 코딩 모델 비교의 하루
실작업으로 먼저 증명된 쪽
저녁 8시 24분, 한 참여자가 자기 사이트 수정 작업을 전부 GLM5.3플래시로 하고 있다고 밝혔다. 벤치마크 점수를 인용한 것이 아니라 지금 굴러가는 작업을 근거로 내놓은 후기였다. 6분 뒤 다른 참여자가 개인적으로는 GLM5.3이 더 잘하는 것 같다며 같은 방향으로 거들었다. 저가 모델 이야기가 성능 의심이 아니라 사용 보고로 시작된 셈이다.
이어진 대화에서는 평가의 기준 자체가 옮겨갔다. 밤 9시 23분, 한 참여자는 딥시크가 아무리 싸도 현재 가성비 1등은 swe-2라고 정리하면서 하루 1억 토큰 정도를 쓸 수 있다는 점을 근거로 들었다. 같은 메시지에서 딥시크는 오픈코드고와 커맨드코드 양쪽 이벤트가 그날로 종료됐고, 그래도 하려면 사용량을 더 주는 커맨드코드가 낫다는 비교까지 덧붙였다. 모델의 품질이 아니라 그 모델을 얼마나 오래 돌릴 수 있느냐가 순위를 결정한 것이다.
벤치는 GLM, 후기는 딥시크
자정을 넘기자 어긋나는 관찰이 올라왔다. 새벽 0시 37분, 한 참여자는 GLM5.3플래시가 벤치는 더 좋은데 딥시크4.1플래시가 후기는 더 좋은 묘한 결과가 재미있다고 적었다. 덧붙여 딥시크가 은근히 블렌더도 잘 쓰는 것 같다는 관찰을 남겼다. 점수표와 사용자 인상이 서로 다른 답을 내놓는 상황을 정면으로 짚은 발언이다.
"GLM은 진짜 프론티어 모델 아닌 것들도 다시보게 만들었어요 정말로"
비슷한 시각에 나온 이 평가는 개별 모델보다 등급 전체에 대한 인식이 바뀌었음을 보여준다. 프론티어가 아닌 모델도 실작업에 쓸 만하다는 경험이 쌓이면서, 상위 모델을 기본값으로 두던 습관이 흔들리는 국면으로 보인다. 같은 날 이 방에서 상위 모델의 체감 저하 불만이 따로 돌았다는 점을 함께 놓으면 흐름은 더 또렷해진다.
점수보다 한도가 선택을 가른다
벤치와 후기가 갈린다는 관찰은 순위표의 한계를 시사한다. 벤치마크는 정해진 문제를 얼마나 맞히는지를 재지만, 실사용 만족은 반복 작업에서 얼마나 덜 어긋나는지와 중간에 끊기지 않는지까지 포함한다. 두 측정이 다른 것을 재고 있으니 결과가 갈리는 것도 이상한 일은 아니며, 이날 대화는 그 간극을 사용자들이 직접 메우고 있는 현장에 가까웠다.
다만 이날 비교가 전부 개인 후기로 이뤄졌다는 점은 함께 짚을 대목이다. 같은 과제를 여러 모델에 던져 결과를 나란히 놓은 사례는 나오지 않았고, 사이트 수정이나 블렌더 활용처럼 각자 다른 작업에서 얻은 인상이 한자리에 모인 형태였다. 그래서 이 비교는 순위표보다 서로 다른 용도에서 건진 관찰의 모음에 가깝다.
그 결과 선택 기준의 무게중심이 점수에서 한도로 옮겨간 것으로 보인다. 하루 1억 토큰이라는 수치가 가성비 1등의 근거로 제시되고, 이벤트 종료로 사용량이 깎인 쪽이 곧바로 후순위로 밀린 것이 그 증거다. 모델 성능 차이가 좁혀졌다고 느끼는 구간에서는, 무엇이 더 똑똑한가보다 무엇을 더 오래 돌릴 수 있는가가 실질적인 비교 축이 된다.