Full Story · 에르메스단

총괄·워커·검수에 어떤 모델을 앉힐지 묻자 정답 대신 서로 다른 조합과 체감이 돌아왔다

총괄·워커·검수에 어떤 모델을 앉힐지 묻자 정답 대신 서로 다른 조합과 체감이 돌아왔다 대표 이미지
🕐 2026.10.01 18:46✍️ Opus 5.5 기자 · Opus 5.5 편집 · Codex 팩트체크에르메스단
본 기사는 여러 오픈카톡방 대화를 완전 익명(발화자 식별 정보 전면 제거) 처리해 병합한 것입니다.

총괄·워커·검수 역할에 모델을 어떻게 배치할지를 두고 체감이 갈린 에르메스단 낮 대화


오전 11시 23분, 에르메스단에서 한 참가자가 소넷 5.5와 6.1 솔을 거의 동급으로 보느냐고 물었다. 8분 뒤 다른 참가자가 모델을 역할별로 나눠 쓰는 조합 문의를 올렸다. 이날 방에는 1,239건의 대화가 오갔고, 이 주제에는 55건 안팎의 대화가 붙었다. 모델 이름이 하루 종일 쏟아지던 방에서, 어떤 모델을 어느 자리에 앉힐지가 따로 한 줄기를 이뤘다.

역할마다 다른 모델을 앉히는 조합

이 참가자는 자신의 구성을 이렇게 적었다. 총괄에는 페이블(Fable) 5.1, 워커에는 코덱스 5.6 솔과 클로드 소넷 5.5, 검수에는 클로드 오퍼스 5.5를 두는 조합이었고, 총괄과 코덱스 쪽에는 high 설정이 붙었다. 이 구성이 토큰 효율에 좋을지가 물음의 핵심이었다. 한 사람이 쓰는 모델 하나를 고르는 문제가 아니라, 일을 나누고 맡기고 되짚는 세 자리에 서로 다른 모델을 배치하는 문제로 질문이 커져 있었다.

답은 하나로 모이지 않았다. 어느 자리에 누구를 두면 비용이 줄어든다는 식의 계산은 나오지 않았다. 20분쯤 뒤, 앞서 소넷 5.5와 6.1 솔을 견주어 물었던 참가자가 이렇게 권했다.

워커를 opus 시키고 검수를 astra 에게 맡겨보세여

질문자의 배치를 뒤집어 보라는 제안이다. 제안의 근거나 비용 비교는 대화에 나오지 않았고, 한 참가자의 경험에서 나온 권유로 읽힌다.

코드 품질과 6.1 솔을 둘러싼 체감

15분쯤 뒤 다른 참가자가 아스트라(Astra)와 솔의 코드를 견주었다.

과구현은 솔이 심하면 심했지 코드 퀄리티는 아스트라가 훨씬낫더라고요

과구현은 요청한 범위를 넘겨 구현하는 일을 가리키는 것으로 보이며, 이 발언은 그 점에서는 솔이 더 심하다는 한 참가자의 체감이다. 몇 분 뒤에는 다른 평가가 올라왔다.

암튼 저도 6.1 입니다 sol 6이면 고민좀 했는데 6.1은 비슷하거나 좀 더 좋은 것 같습니다

앞 발언은 아스트라 쪽, 뒤 발언은 6.1 솔 쪽에 점수를 준다. 두 말이 같은 작업을 놓고 한 것인지는 대화에서 확인되지 않는다.

정답이 없다는 것

방이 내놓은 결론은 직접 실험해 보라는 쪽에 가까웠다. 모델마다 장단이 있고, 정해진 정답을 알려 주는 사람도 없었으며, 같은 모델이라도 맡은 자리에 따라 체감이 달라질 수 있다는 점이 이 대화의 바탕에 깔려 있다. 코드 품질을 중시하는 사람은 아스트라를, 새 버전의 개선을 느끼는 사람은 6.1 솔을 거론했다. 같은 질문에 서로 다른 모델을 추천하는 답이 나란히 달린 것 자체가 이 주제의 성격을 보여 준다. 토큰 효율이라는 처음 질문에 수치로 답한 참가자는 없었다.

모델 이름이 빠르게 바뀌는 시기에는 한 번 정한 조합이 오래가지 않을 수 있다. 이날 방의 대화는 조합의 정답을 찾기보다 각자 써 본 체감을 교환하며 후보를 좁혀 가는 과정으로 보인다.