소넷 5.5가 워커로 낫다던 한 참가자가 새벽에 「철회」를 적고 오푸스 low가 낫다고 했다
소넷 5.5 워커 평가가 하룻밤 사이 오푸스 low 쪽으로 뒤집힌 에르메스단 대화
밤사이 에르메스단에서 소넷 5.5를 워커로 쓴 체험담이 올라왔다가 새벽에 뒤집혔다. 이 주제에는 15명이 55건을 보탰다. 같은 창에 101명이 623건을 주고받은 방이니, 새벽까지 길게 이어진 대화 가운데 모델 조합 이야기가 한 덩어리를 차지한 셈이다.
먼저 나온 것은 호평이었다. 한 참가자는 소넷 5.5를 워커로 써 본 소감을 묻는 자리에서 자신의 경험을 이렇게 적었다.
어제부터 쓴바로는 '워커' 자질은 소넷이 더 우월하네요.
이 참가자는 소넷 max를 쓰다 high로 다시 실험해 보겠다고 한 직후 이 평가를 남겼고, 조금 뒤에는 소넷 5.5가 너무 적절해서 연구 중이라고도 했다. 다른 참가자는 오푸스를 중간에서 높은 강도로 쓰면서 워커는 소넷 high로 돌린다며 자기 조합을 공개했다. 다만 「어제부터」라는 표현이 말해 주듯 이 평가는 하루 남짓 써 본 체감에서 나온 것이다.
조합 논의는 강도로 옮겨 갔다
호평 뒤에는 조합 논의가 붙었다. 한 참가자는 GPT 모델 조합을 기준으로, Astra에게 오케스트레이팅을 맡기며 medium으로 두고 Sol에게 일을 시키며 high로 두라고 권했다. 소넷과 오푸스 이야기는 아니지만, 역할마다 추론 강도를 따로 주자는 발상은 같은 논의 안에 놓인다. 또 다른 참가자는 오케스트레이션은 오푸스가 맡는 편이 무조건 좋다고 했고, 이유로 캐시 토큰 비용을 들었다.
여기에 높은 모델을 낮은 강도로 쓰는 편이 가성비가 좋다는 의견도 나왔다. 모델 이름보다 누가 지휘하느냐, 어떤 강도로 돌리느냐가 비용 계산의 축으로 올라온 것으로 보인다. 이 의견은 곧이어 나온 반전과 이어진다.
눈여겨볼 것은 의견들이 서로 다른 축에서 나왔다는 점이다. 워커 자질은 일을 시킨 대로 해내는지를 본 평가이고, 캐시 토큰 비용은 지휘 모델을 고르는 기준이며, 강도 배분은 같은 모델도 설정에 따라 값어치가 달라진다는 이야기다. 한 방 안에서 품질, 비용, 설정이라는 세 기준이 한꺼번에 오간 셈이어서, 어느 조합이 낫다는 단일 답이 나오기 어려운 구조로 보인다.
새벽에 뒤집힌 평가
창 말미에 흐름이 바뀐다. 호평을 남겼던 그 참가자는 앞서 예고한 high 재실험 뒤의 결과인지는 알 수 없지만, 새벽 2시가 되기 전 이렇게 적었다.
철회하겠습니다. 오푸스 low가 낫네요
철회의 대상은 원문에 명시되지 않았으나, 앞선 소넷 워커 평가를 거둔 것으로 보인다. 무엇이 어떻게 달랐는지는 digest에 적혀 있지 않아 이유는 확인할 수 없다. 다만 같은 사람이 세 시간 가까운 사이 다른 결론을 냈다는 사실이 눈에 띈다.
이 대목은 해석의 여지를 남긴다. 밤사이의 체감은 작업 종류와 강도 설정에 따라 쉽게 뒤집힐 수 있는 잠정 평가였음을 시사한다. 「워커 자질은 소넷이 더 우월하네요」라는 말과 「오푸스 low가 낫네요」라는 말이 같은 방에서 하룻밤 안에 나란히 놓였다는 점에서, 이 방의 워커 논의는 아직 결론보다 실험 단계에 가깝다고 읽힌다. 이후 비슷한 비교가 더 쌓이는지가 다음 관찰 대상이다.