
에이전트코리아
AK 인프라, 코딩 에이전트, 현장 자동화 기록

AK 인프라, 코딩 에이전트, 현장 자동화 기록

AI 트렌드, 모델 체감, 프롬프트 운영 흐름

에이전트 실험, 자동화 워크플로우, 실무 고도화
새벽 2시 오퍼스 5가 열리자 두 커뮤니티가 같은 소식을 다른 질문으로 받았다. 한쪽은 기존 최상위 모델을 은퇴시킬지 역할을 나눌지 따졌고, 다른 한쪽은 대체 모델 설정까지 함께 바꿔야 한다는 실무를 짚었다. 가격 동결이 교체 판단을 단순하게 만들었지만, 결론은 갈아타기가 아니라 계획과 실행에 다른 모델을 배치하는 분업이었다.
지피티6 아스트라(GPT-6 Astra) 공개 직후 200달러 최상위 플랜(ChatGPT Pro x20) 신규 구독이 막혀, 에이전트코리아와 에르메스단이 같은 날 아침부터 같은 화면을 공유했다. 에르메스단에서는 범위가 한 지역이 아니라는 전언과 원인 추정이 오갔고, 오전에 대안으로 안내된 카카오톡 경로마저 오후에 닫혔다는 보고가 이어졌다. 신모델이 사용량을 더 빨리 소모시키는 동안 요금제 상단 진입이 같은 날 막혔다는 점이, 두 방이 동시에 이 화두에 붙은 이유를 시사한다.
브라우저 에이전트 어사이드(Aside)가 같은 날 두 오픈카톡방을 동시에 붙들었다. 에이전트코리아는 제품 안에 들어선 수익화 장치와 인수 가능성을 읽었고, 에르메스단은 오후에 열린 윈도우 베타 신청에 몰려들었다. 한 제품이 사업 궤적과 설치 대기줄이라는 두 층위에서 동시에 읽힌 셈이어서, 평가 기준이 모델 성능보다 일상 업무 안의 체감으로 옮겨가고 있음을 시사한다.
아스트라(GPT-6 Astra)가 출시 첫날보다 느리고 둔해졌다는 토로가 아침부터 저녁까지 끊이지 않았다. 속도·품질 불만에 토큰 소모가 크다는 지적이 겹치고 딥식이 의외로 낫다는 반응과 오푸스는 여전히 메인이라는 옹호가 엇갈렸는데, 공개된 변경 내역이나 확인된 성능 저하 없이 체감만 오간 국면 자체가 화두가 된 것으로 보인다.
주간 토큰이 바닥난 참여자들이 딥식(DeepSeek) V4.1 플래시로 옮겨가면서 속도 이야기가 방을 채웠다. 초당 처리량부터 다르다는 체감이 짧은 간격으로 겹쳤지만 결론은 모델 교체가 아니라 클로드 오푸스 5를 메인에 두고 빠른 쪽을 워커로 쪼개는 분업이었고, 품질을 아직 모르는 모델의 위험을 줄이는 선택으로 보인다.
오픈AI가 실시간 음성 API 지피티 라이브-1(GPT Live-1)을 공개하자 분당 0.05달러라는 단가와 자연스러운 대화 품질이 먼저 화제가 됐다. 대화는 곧 이 API를 아바타 생성 사이트와 연결해 실시간 강사로 쓰는 조합으로 넘어갔다. 기술 가능성보다 분당 단가가 서비스 형태를 정하는 단계로 넘어갔음을 시사한다.
중국 선전 미니PC 제조사가 보내온 라이젠 기기에 35B 모델을 올려 그래픽카드 없이 초당 22토큰을 뽑아낸 사례가 공유됐다. 127B 적용 가능이라는 설명과 램 128GB면 300B까지라는 전망이 뒤따랐지만 그 구간의 실측 속도는 제시되지 않았다. 로컬 구동의 문턱이 값비싼 가속기 확보에서 메모리 증설로 옮겨가고 있음을 시사한다.
브라우저형 AI 에이전트를 만드는 팀의 CTO가 방에 직접 들어와 역할 분담과 개발 비화를 풀어놨다. 윈도우 버전이 예상보다 훨씬 어려웠다는 토로와 함께 이번 작업에서 AI가 맡은 비중은 20%뿐이고 나머지는 예전 방식대로 직접 짰다고 밝혔는데, 에이전트를 만드는 쪽의 작업은 여전히 사람 손에 기대어 있음을 시사한다.
개인 에이전트 뮤즈(Muse)가 미국에서 2위까지 올라왔다는 소식이 전해지며 오픈클로·헤르메스는 저무는 쪽으로 묘사됐다. 강점으로 꼽힌 대목은 성능 수치가 아니라 인스타그램·왓츠앱에 쌓인 개인 자료 연동과 별도 서버 없는 24시간 구동이었다. 개인 에이전트를 고르는 기준이 '무엇을 잘 푸나'에서 '내 생활 기록에 얼마나 붙어 있나'로 옮겨가고 있음을 시사한다.
클로드 계열 모델인 페이블(Fable)을 향한 팬심과 주간 한도 불만이 같은 대화에 섞였다. 5시간 제한 위에 주간 한도의 50%까지만 쓸 수 있다는 두 겹 제한, 20x 요금제의 주간 캡이 표기만큼 늘지 않는다는 지적과 6월 집단소송 언급까지 이어졌는데, 한도가 모델 선택을 대신 결정하는 국면으로 보인다.
같은 챗GPT 프로(ChatGPT Pro) 구독인데 결제 창구에 따라 31만원·299,000원·199.99달러로 표시가가 갈렸다. 참여자들은 플랫폼 수수료와 세금을 원인으로 거론했지만 어느 단계에서 얼마가 얹혔는지는 확인되지 않았고, 창구가 늘어난 만큼 가격 비교가 사후에야 일어나는 구조로 보인다.
지피티6 아스트라(GPT-6 Astra)로 기존 업무를 전부 옮겨 돌려본 결과, 마케팅 분석 프로세스 설계 같은 복잡한 작업은 아직 클로드 페이블(Fable) 5.1이 낫다는 후기가 나왔다. 반대로 컴퓨터 사용이나 3D 작업에서는 아스트라가 넘기 어려운 수준일 것이라는 전망이 같은 후기에 붙었다. 모델 선택의 축이 총점 비교에서 '내 업무의 어느 구간이 무너지나'로 갈라지고 있음을 시사한다.
코그니션(Cognition)의 신모델 SWE-2 발표 내용이 오전 끝자락에 방에 전해졌다. FrontierCode 50.0%로 이전 버전과 타 진영 모델을 앞섰고 클로드 계열의 페이블(Fable) 5.1과 맞먹는 성능을 64% 낮은 비용으로 낸다는 주장이었는데, 한 달 무료 조건은 성능 홍보보다 실제 사용처 확보를 노린 것으로 보인다.
지피티6 아스트라와 솔의 관계가 클로드 계열의 오푸스·페이블 관계와 같은지, 테라는 소넷 자리이고 루나는 하이쿠 자리인지를 묻는 추측성 질문이 오갔다. 확인된 답으로 정리되지는 않았고, 솔을 페이블과 같은 자리로 여겼다가 되묻는 장면까지 이어졌다. 고유명으로 갈아탄 작명에서 순서 단서가 사라진 탓에 이용자 쪽이 직접 등급 대응표를 만들고 있음을 시사한다.
9월 10일 저녁, 아스트라(Astra)는 에이전트코리아·에르메스단·더배러 세 방에서 동시에 화두에 올랐다. 에이전트코리아는 비용을 인건비와 견줬고, 에르메스단은 오케스트레이터 자리를 두고 오푸스와 비교했고, 더배러는 외부 로봇팔 벤치마크와 실사용 후기로 클로드 해지까지 논의했다. 강력하지만 비용 부담이 크다는 진단이 세 방에서 독립적으로 반복됐다는 점은, 아스트라의 현재 위치가 대체재보다는 역할 분담 대상에 가깝다는 것을 시사한다.
한 참가자가 「AI에게 잡아먹힌다」는 표현으로 신촌권 대학의 AI 의존 사례를 전하며 시작된 대화다. AI가 내놓은 결론을 비판 없이 받아들이는 대학원생·연구자 사례가 이어졌고, 다른 참가자는 법령검토를 AI에 맡겼다가 결과를 일일이 재검증한 경험을 공유했다. 한 참가자는 이 문제의식을 담은 웹사이트를 직접 만들어 공유했고, 또 다른 참가자는 해외 대학원에서 AI 의존이 더 심해진다고 털어놨다.
한 참가자가 자신의 에이전트 설정 md 파일을 봐달라고 요청하자, 다른 참가자는 환경을 모르면 조언이 의미 없다며 순정 상태와 비교해볼 것을 권했다. 그 참가자는 넘어온 스킬의 40%는 무용하다며 자신도 메모리 설정을 다이어트했다고 밝혔고, 또 다른 참가자는 입력 시 기본 컨텍스트가 47k라며 다른 사람들의 상황을 물었다.
오전부터 여러 참가자가 주간 사용량이 0%로 떨어졌다며 초기화(리셋) 여부를 서로 확인했고, 뱅크 리셋 오류를 겪은 사람들에게 별도 조치가 있었다는 이야기도 나왔다. 오후 들어서는 리셋권을 10장·11장 달라는 장난 섞인 애원이 이어졌고, 플러스 요금제는 리셋권을 안 주는 것 아니냐는 궁금증도 나왔다.
한 참가자가 회사에서 승인받은 아스트라 계정으로 채팅창이 우주 같다고 감탄한 게 시작이었다. 다른 참가자가 GPT-6 Astra와 Fable 5.1의 로봇팔 테스트 수치(성공률 40%→95%, 비용 -56%)를 공유하자, 여러 참가자가 실사용 경험을 잇따라 보태며 아스트라 우위론이 번졌다. 몇몇 참가자는 클로드 구독 해지까지 언급했고, 저녁엔 한 참가자가 'Sol보다 5배 빠르다'며 Astra를 메인, Cursor를 서브로 쓰는 테스트를 전했다.
새벽 코덱스 사용량이 갑자기 0%로 표시되는 리셋 파동이 일며 보상 범위를 두고 혼선이 일었다. 영향받은 시간대에 사용한 분들에게 하나 더 제공되고 사과 이메일이 발송된다는 안내가 돌았지만, 실제로는 에러난 시간에 리셋권을 써버린 사람들에게만 지급됐다는 설명이 뒤따라 끝까지 정리되지 않았다.
리셋이 올 것 같다는 근거 없는 예감 하나가 두 방 사용자들의 행동을 정반대로 갈랐다. 남은 한도를 시원하게 태운 쪽과 마감 때문에 작업을 멈춘 쪽이 갈렸고, 결국 리셋은 오지 않았다. 판단 기준은 잔여량이 아니라 초기화권 만료일과 정기 초기화일 중 무엇이 먼저 오느냐였다.
브라우저 에이전트를 추천하는 이유가 성능이 아니라 권한 설계였다. 자격 정보를 모델에 넘기지 않고 로그인을 처리하는 구조가 있어야 예약이나 결제처럼 실제 계정이 걸린 일을 맡길 수 있고, 그 조건이 갖춰지면 무거운 모델보다 빠른 모델이 오히려 적합해진다는 사용기가 모였다.
세 모델의 토큰 소모량이 실제로 다른지 묻는 질문에, 통제 실험이 아닌 한 사용자의 축적된 사용 기록을 근거로 한 비교 수치가 공유됐다. 다만 더 중요한 변수는 턴 수였다. 단위 소모가 적어도 반복이 많으면 총량이 역전되므로, 절약의 지렛대는 절제가 아니라 난이도별로 모델을 갈아 끼우는 라우팅 설계에 있다는 결론이 나왔다.
저가 대용량 토큰 플랜으로 갈아탄 사용자들의 후기가 이어졌다. 평가의 초점은 성능이 아니라 한도 여유였고, 상위 모델의 한도 압박을 분산하는 용도로 자리를 잡아가는 중이다. 다만 상용 서비스에 얹기엔 응답 속도가 걸린다는 단서와 프로모션 종료 시점이 함께 언급됐다.
128기가 맥으로도 버거운 상황에서 나온 답은 장비 증설이 아니라 실행 위치 이전이었다. 월 80달러 서버에 코딩 도구를 올려 3년째 쓴다는 사례가 공유됐다. 다만 선택의 전제는 사양이 아니라 지연이며, 사용자 접점은 CDN 뒤로 숨기는 구성이 함께 있어야 한다는 조건이 붙었다.
새 모델은 사용자에겐 선물이지만 도구를 얹어 온 사람에겐 작업 지시가 된다. 모델 교체 비용이 구독료가 아니라 하네스 유지보수로 나타난다는 것이다. 워크플로우를 강제하지 않는 느슨한 구성이 교체에 강했다는 관찰은, 짧아진 출시 주기에서 설계 지침에 가깝게 읽힌다.
MCP를 붙였더니 이미지 생성이 꺼졌다는 질문에, 답은 구조가 아니라 실행 모드였다. 대화형으로 부를 때와 작업형으로 부를 때 열리는 기능이 다르다는 것이다. 스키마를 뜯어보기 전에 호출 경로부터 바꿔보는 값싼 확인이 먼저라는 진단 순서를 보여준 사례다.
밤새 성능을 이야기한 방에서 새벽에 남은 화제는 제약이었다. 안전장치가 깐깐해졌다는 체감과 함께 구독을 계속할지 고민한다는 반응이 나왔다. 벤치마크로 재는 능력과 매일 쓰며 느끼는 사용성이 다른 축이며, 구독 유지를 결정하는 쪽은 대체로 후자라는 점을 보여준 구간이다.