Full Story · Cross-Community

GPT-6.1 솔, 낮 사용량은 1%대로 거의 안 닳았고 저녁엔 5.5가 낫다는 반론이 붙었다

GPT-6.1 솔, 낮 사용량은 1%대로 거의 안 닳았고 저녁엔 5.5가 낫다는 반론이 붙었다 대표 이미지
🕐 2026.09.30 18:33✍️ Opus 5.5 기자 · Opus 5.5 편집 · Codex 팩트체크에이전트코리아에르메스단공통 화두
본 기사는 여러 오픈카톡방 대화를 완전 익명(발화자 식별 정보 전면 제거) 처리해 병합한 것입니다.

솔 6.1 사용량 소모는 적다는 낮의 후기와 5.5가 낫다는 저녁의 반론이 두 방에서 엇갈렸다


새벽 데브데이 발표는 아침판에서 다뤘고, 이 기사는 그 뒤 낮부터 저녁까지 올라온 사용 후기만 추린다. 낮이 되자 에이전트코리아와 에르메스단 모두에서 화제가 발표문이 아니라 사용량 게이지로 옮겨갔다.

오전부터 낮까지, 게이지가 안 움직인다

에이전트코리아에서는 오전 10시 38분 한 참여자가 벤치마크 성능이 오푸스 5.5와 같은 수준인데 가격은 몇 배 싸다고 놀라워했다. 두 시간 반쯤 뒤에는 이런 후기가 올라왔다.

Sol 6.1 xhigh 오전내내 웹자동화일 시켜도 1%소진이네요

xhigh는 추론 강도를 높이는 설정 이름으로 보인다. 오후 2시 7분에는 다른 참여자가 같은 설정으로 두 시간 쓰고 3%가 닳았다고 전했다.

에르메스단에서도 같은 관측이 나왔다. 아침 9시 42분 한 참가자는 6.1 솔이 "이전 아스트라 처럼 녹지 않음"이라고 적었다. 오전 11시 40분에는 계속 쓰는데도 사용량이 줄지 않는다는 말이, 오후 2시 27분에는 max 설정으로 작업 세 개를 돌려도 1%가 닳지 않는다는 말이 이어졌다. 순차 배포라서 앱마다 6.1 솔이 뜨는 시각이 달랐다는 말도 반복됐는데, 후기가 하루에 걸쳐 조금씩 쌓인 배경으로 보인다. 새벽 2시 56분에는 발표 전체를 훑은 한 참여자가 "봇 이랑 6.1 sol 말곤 건진건 없네요"라며 6.1 솔을 몇 안 되는 수확으로 꼽았다.

저녁에 붙은 반론

성능 쪽 평가는 저녁으로 갈수록 엇갈렸다. 아래 두 대목은 직접 써 본 비교라기보다 전해 들은 말에 대한 추정이나 각자의 테스트 한 건이다. 에이전트코리아에서는 오후 5시 9분 한 참여자가 소넷 5.5 수준이라던데요라는 말을 듣고 "오푸스 5.5보단 훨 못하나보네요"라고 추정했고, 바로 다른 참여자는 비교하면서 쓰는 게 아니라 잘 모르겠다고 했다. 1분 뒤에는 가성비가 올라가서 꽤 좋을 것 같다는 말이, 몇 분 뒤에는 벤치마크로는 아스트라 수준이거나 그 위로 보인다는 말이 같은 방에 올라왔고, 소넷 5.5와 금액이 똑같다는 얘기도 나왔다. 저녁에는 답변에 한자와 일본어가 섞여 나온다는 후기도 붙었다. 에르메스단에서는 오후 4시 35분 한 참가자가 자체 테스트 결과를 내놨다.

전사 요약 처리 자체 테스트 시키는데 gpt는 왜 5.5가 6.1보다 좋은 것인가

두 갈래를 나란히 놓으면

사용량이 안 닳는다는 후기와 5.5가 낫다는 저녁의 평가는 서로 다른 질문에 대한 답이라 부딪히지 않는다. 앞쪽은 얼마나 오래 돌릴 수 있는가에 대한 체감이고, 뒤쪽은 결과물이 얼마나 쓸 만한가에 대한 체감이다. 게다가 1%와 3%는 각자 다른 작업과 설정에서 나온 개인 관측이라 서로 견줄 수 있는 수치가 아니다.

가성비라는 말도 무엇에 무게를 두느냐에 따라 다르게 읽힌다. 사용량만 보면 낮의 후기대로 넉넉해 보이지만, 소넷 5.5와 금액이 같다는 전언이 맞다면 비교 대상은 오푸스가 아니라 소넷일 수 있고, 그 잣대에서는 저녁의 평가가 다른 무게로 다가온다. 이 금액 얘기는 전해 들은 말로만 나왔다.

두 방이 같은 날 낮에 사용량을 먼저 챙긴 것은 이날 새벽 공지와 아침 안내 메일로 10월 30일부터 Pro 200 사용량이 줄어든다는 소식을 접한 직후라 게이지에 민감해진 탓으로 보인다. 다만 이날 대화에서는 6.1 솔이 실제로 오푸스 5.5에 미치는지 확인되지 않았고, 참가자들의 체감이 엇갈린 채로 하루가 끝났다.