Flux 3와 ELO 점수가 놓치는 이미지 모델의 맛
Flux 3, 나노바나나 프로, 미드저니를 두고 벤치마크 점수가 취향과 용도를 다 설명하지 못한다는 에이전트코리아 방의 대화
밤 11시 9분, 에이전트코리아 방에서 이미지 모델 이야기가 시작됐다. 한 참가자가 새로 나온 Flux 3가 마음에 든다고 적었다. 이날 방에는 34명이 364건을 남겼는데, 이 주제는 5명이 78건을 나눠 참여자 수 대비 발화량이 두드러졌다.
그래서 이번 flux 3도 아주 맘에 듭니다
5명이 78건을 나눈 만큼 짧은 의견이 여러 번 오간 것으로 보이지만, 논점은 비교적 선명했다.
마음에 든다와 못 넘는다 사이
이 말을 받은 다른 참가자의 반응은 단서가 붙은 동의였다. Flux 3가 되어도 아직 나노바나나 프로(구글의 이미지 생성 모델)를 못 넘는다는 것이다. 신제품에 대한 호평 옆에 기존 강자를 기준으로 한 반론이 바로 붙은 모양새다. 두 문장은 부딪히는 듯 보이지만, 한쪽은 쓰는 사람의 만족을, 다른 쪽은 모델 사이의 상대 위치를 말하고 있어 같은 잣대 위에 놓인 의견은 아니다.
반론을 편 참가자는 이어 모델끼리 겨뤄 매기는 순위 점수인 ELO를 직접 겨냥했다.
그 ELO가 모든 걸 설명해주지 못합니다
벤치의 한계라는 데서 모인 의견
처음에 Flux 3를 칭찬했던 참가자가 "벤치의 한계죠 ㅠ"라고 받으면서 대화는 모델 평가 방식 쪽으로 옮겨 갔다. 점수가 높다고 해서 손에 쥐고 써 보는 만족이 같지 않고, 반대로 점수에 다 잡히지 않는 장점이 있다는 감각이 두 사람 사이에서 공유된 것으로 보인다. 다만 어떤 항목이 점수에서 빠지는지까지는 대화에 나오지 않았다.
그 직후 반론을 폈던 참가자는 모델 이름 대신 용도를 꺼냈다. "생각 자체를 형상화 시키는건 미드저니가 가장 좋다고 보는데"라는 말이다. 기능이나 해상도를 비교하는 대신 머릿속 생각을 그림으로 옮기는 과정에 기준을 둔 평가다.
이 의견은 한 사람의 판단으로 나왔고 다른 참가자의 동의가 확인된 것은 아니다. 그래도 순위표가 보여 주는 성능과 결과물이 생각을 얼마나 잘 닮았는가는 서로 다른 질문이라는 점을 이 말은 드러낸다.
정보는 어디서 얻나
대화의 끝자락에는 AI 정보를 얻는 커뮤니티로 아카라이브와 레딧이 거론됐다. 이미지 모델 이야기가 이어진 끝에 나온 언급이며, 어느 쪽이 더 믿을 만한지까지는 대화에 나오지 않았다.
신제품이 나올 때마다 순위표가 먼저 도착하지만 쓰는 사람의 체감은 그다음에 갈린다는 장면으로 읽힌다.
호평과 반론, 그리고 미드저니라는 제3의 이름이 한자리에서 나왔다는 점도 이 방의 기준이 하나가 아니라는 뜻으로 보인다. 어느 모델이 낫다는 결론은 나지 않았고, 무엇으로 재야 하는가가 남은 질문이었다. 점수는 비교를 쉽게 해 주지만 취향까지 대신 답해 주지는 않는다는 것이 이날 밤 대화의 요지로 보인다.