21일 아침 번진 GPT-6 아스트라(Astra) 토큰 불만, 사흘 새 방마다 모델과 추론 강도(effort) 셈법을 다시 짰다
아스트라 성능 저하·토큰 급소모 체감과, 그 대응으로 나온 모델·effort 고르는 요령
21일 오전 8시 48분, 에르메스단에 "지능 난도질 당한느낌이 좀 있어요.."라는 한 줄이 올라왔다. 9시 33분 더배러에선 "요즘 아스트라 안쓰고, 솔만 써도 충분하네요."라는 말이 나왔는데, 이 솔은 GPT-5.6 솔이다. 10시 10분 에이전트코리아에서도 아스트라가 멍청해지고 토큰만 녹는다는 하소연이 시작됐다.
수치로 남은 소진, 전언으로 돈 원인
"간밤에 astra high가 제 토큰을 20만원어치 태우고 산출물이 0입니다. 믿겨지십니까?"
에르메스단에선 21일 아침 이런 하소연에 이어, 오후엔 같은 작업에 5일 한도의 24%가 2시간 만에 사라졌다는 후기가 나왔다. 22일엔 두 방에 비슷한 전언이 돌았다. 에이전트코리아엔 낮에 아스트라 요청이 GPT-5.6 루나로 라우팅된다는(요청이 다른 모델로 넘겨진다는) 커뮤니티 글이, 에르메스단엔 오후에 최근 추가로 열린 구독에서 아스트라가 루나로 라우팅되는 이슈가 있다는 말이 올라왔다.
22일 밤엔 반대 체감도 나왔다. 에르메스단 11시 45분엔 "뭐지 아스트라 겁나 똑똑한데요 지금?"이라는 반응이, 에이전트코리아에선 메모리를 초기화하니 다시 똑똑해졌다는 경험담이 올라왔다. 에르메스단 대화엔 원인에 대한 오픈AI의 공식 설명이 나오지 않았다.
요령은 effort에서 갈렸다
에이전트코리아에선 21일 오후 "low쓰시고 막힐때만 올려보세요"라는 요령과 함께, 모델과 effort(low·medium·high·xhigh 순으로 더 오래 생각하게 하는 설정)를 자주 바꾸면 캐시(앞서 처리한 내용을 재사용해 사용량을 아끼는 장치) 이점을 잃는다는 정리가 나왔다. 그런데 같은 날 점심 화제가 된 모델 간 게임 대전 벤치마크에선 아스트라 xhigh가 승률 100%에 토큰도 덜 썼고, 더배러에서도 22일 오후 미디엄이 오히려 사용량 하마라는 말과 함께 "xhigh 가 실제 테스트 완성기준으론 덜들어요"라는 경험담이 나왔다.
더배러는 모델 자체를 낮추는 쪽도 저울질했다. 22일 오전 아스트라를 떠나 솔로 가겠다는 참여자에게 생각을 많이 한다고 좋은 게 아니며 때로는 테라가 낫다는 답과, 과추론이 GPT 모델의 고질이라는 지적이 돌아왔다. 추론형 질문에선 아스트라와 솔의 차이가 보인다는 반론, 패스트 모드가 표준 요율보다 사용량을 더 차감한다는 설명도 곁들여졌다.
단가보다 완성까지의 총량
이 불만은 새것이 아니다. 직전 아침판(20일 낮~21일 새벽)에도 에르메스단엔 아스트라가 멍청해졌다는 불만이, 에이전트코리아엔 소모량이 너무 크다는 하소연이 있었다. 같은 모델을 쓰는 사람들이 방을 가리지 않고 비슷한 체감을 호소했고, 공식 설명이 없으니 각 방이 저마다 대응 요령을 찾아 나선 것으로 보인다.
low부터 쓰라는 요령과 xhigh가 덜 든다는 경험은 얼핏 부딪힌다. 다만 두 방에서 따로 나온 xhigh 쪽 경험은 요청 한 번의 단가보다 일을 끝내기까지 드는 총량을 잰 것으로 읽힌다. 23일 새벽 공유된 GPT-6 솔·루나 발표 요약엔 추론 강도를 바꿔도 캐시가 유지된다는 내용이 담겼고, 같은 날 오전엔 아스트라를 effort를 바꿔도 상관없는 모델로 꼽는 말도 나와, effort를 고르는 셈법이 다시 짜일 여지가 생긴 것으로 보인다.