Head Story · Cross-Community

오푸스 5.5 첫 밤 실측, 페이블과 표본 50개에서 비겼고 한도는 덜 닳았다는 전언이 두 방에 쌓였다

🕐 2026-09-24에이전트코리아에르메스단공통 화두
본 기사는 여러 오픈카톡방 대화를 완전 익명(발화자 식별 정보 전면 제거) 처리해 병합한 것입니다.

출시 뒤 첫 밤, 에이전트코리아와 에르메스단이 오푸스 5.5의 성능과 사용량을 각자 어떻게 쟀나


23일 저녁 6시 45분, 에이전트코리아에 페이블(같은 클로드 계열 모델)과 오푸스 5.5로 오케스트레이션(여러 AI 작업자를 한 모델이 지휘하는 구성) 표본검사 50개를 돌렸다는 보고가 올라왔다. 결과는 별 차이가 없었고, 이 참여자는 페이블을 검수 쪽으로 돌리고 지휘는 오푸스에 맡기겠다고 했다. 어제 저녁판이 반나절 사용기의 호평과 경계를 전했다면, 밤사이 두 방에선 그 인상을 숫자로 옮긴 전언이 쌓였다. 1,775건이 오간 에이전트코리아는 이 이야기로 밤을 열었고, 289건이 오간 에르메스단의 밤도 오푸스 5.5 사용량 이야기로 가득 찼다.

에이전트코리아, 표본검사와 막힌 과제로 성능을 쟀다

에이전트코리아는 비교 검사와 실전 과제로 말했다. 표본 50개 보고에 이어 밤 8시께엔 한 참여자가 3주 동안 아스트라(오픈AI GPT-6 계열)로도 풀지 못하던 모델 개선을 5.5가 바로 찾아냈다고 전했다. 어제 저녁판에선 가장 낮은 추론 강도(effort, 모델이 얼마나 오래 생각할지 정하는 설정)인 low가 없으나 마나라는 의견이 있었는데, 이날 밤엔 5.5 로우를 두고 다른 평이 나왔다.

"싸고 빠르고 똑똑해"

한도 실측도 붙었다. 저녁 6시 27분 한 참여자는 오푸스 5.5로 워커 15 ~ 20기를 지휘하며 3시간에 주간 한도 16%를 썼다고 공유했다. 밤 11시께엔 다른 참여자가 솔 6(GPT-6 솔)으로 많은 작업을 하고도 10%만 소진됐다고 했고, 1분 뒤엔 사용량을 일부러 늘려 준 것 같을 만큼 토큰 소모가 적다는 반응도 나왔다. 다만 솔과 아스트라의 가격 차이를 묻는 질문, 5.6 솔이 더 비싸다는 반응도 함께 돌았다.

에르메스단, 사용량 체감과 강도 선택으로 답했다

에르메스단의 관심은 우열 논쟁에서 사용량 체감으로 옮겨 갔다. 저녁 7시께 한 참여자는 10시간 넘게 돌리고도 주간 한도 절반을 쓰지 않았다고 했다. 다른 참여자는 서브에이전트를 많이 돌려도 메인 세션의 컨텍스트가 덜 찬다고 전했다.

"10시간 넘었는데 주간한도 50%도 안썼습니다"

페이블과의 선은 작업 길이로 그어졌다. 밤 8시 20분께 한 참여자는 수 시간짜리 긴 작업에선 페이블이 아직 더 유용하지만 웬만한 작업은 오푸스로 충분하다고 했다. 적정 강도를 묻는 질문에는 미디엄이면 충분하다는 답과 더 높은 강도를 권한 답이 함께 나왔다. 밤 9시께 헤르메스(Hermes) 에이전트의 오케스트레이션 모델로 아스트라와 오푸스 5.5 중 무엇을 둘지 묻는 질문에는 "Opus 5.5 Medium"이라는 답이 붙었다.

같은 질문, 다른 자

두 방은 같은 두 가지를 물었다. 얼마나 좋은지, 그리고 얼마나 닳는지다. 에이전트코리아는 표본 수와 시간당 한도 비율처럼 조건을 붙인 숫자로 답했고, 에르메스단은 긴 시간 써 본 체감과 작업 종류별 쓰임새로 답했다. 낮에 실제 일을 붙여 본 사람들이 몇 시간씩 돌린 결과를 저녁 이후 가져오면서, 두 방에 같은 시간대 후기가 쌓인 것으로 보인다.

어제 저녁판이 전한 경계, 곧 출시 뒤 성능이 떨어졌던 전례와 첫날 버프(출시 직후 성능이 유독 좋게 느껴지는 현상)에 대한 걱정은 밤에도 사라지지 않았다. 에이전트코리아에선 곧 너프(성능 하향)될 테니 지금 달리라는 말이 저녁 6시에 돌았다. 숫자가 쌓여도 조심스러운 태도가 이어진 것은, 참여자들이 이 수치를 개인 조건에서 나온 한때의 관측으로 받아들이고 있음을 시사한다. 16%, 10%, 절반 미만이라는 수치 모두 각자의 작업량과 요금제에서 나온 전언이어서 서로 바로 견주기는 어렵다.