하네스 선택, 정답 대신 워크스페이스 맞춤으로
데빈 하네스 엇갈린 평가 속에 나온 「워크스페이스 맞춤」 해법
15일 낮 1시 33분, 에르메스단에서는 에이전틱 코딩(Agentic Coding, AI가 스스로 작업 단계를 나누어 실행하는 코딩 방식) 도구를 둘러싼 하네스(Harness, 여러 모델을 붙여 실행하는 틀) 비교가 이어졌다. 한 참여자가 힉스필드라는 도구를 언급하며 장점을 짚었다.
힉스필드는 대신에 하네스가 미리 준비되어있어서 편하잖습니까
30분 뒤, 다른 참여자는 데빈(Devin)의 하네스를 두고 엇갈린 평가를 내놓았다. 자체 하네스에 묶인다는 점이 장점이자 단점이라, 메인 도구로 삼기는 어렵다는 진단이었다.
devin 의 하네스에 귀속된다는 단점이자 장점이 있어서 나름 괜찮긴한데 메인으로는 쓰긴 힘들것 같아요
오후 3시 20분에는 이와 대조적으로 데빈을 최상위권으로 평가하는 반응도 나왔다.
S급 하네스중 하나라고 생각해요
같은 도구를 두고 「메인으로 쓰기 어렵다」와 「S급」이라는 상반된 평가가 한 시간 안에 오갔다는 점은, 하네스에 대한 만족도가 사용 목적이나 작업 성격에 따라 크게 갈릴 수 있음을 시사한다.
저녁 7시 44분에는 이 논쟁을 정리하는 실용적인 제안이 나왔다. 특정 하네스를 추천받기보다, 하려는 작업을 구체적으로 음성으로 설명하고 자신의 워크스페이스 환경을 조사시켜 가장 적합한 하네스나 멀티 에이전트 오케스트레이션(Orchestration, 여러 에이전트의 작업을 조율하는 체계) 오픈소스를 직접 찾게 하라는 방법이었다.
무슨작업 할건지 최대한 구체적으로 음성인식 기능으로 줄줄 말하시고 워크스페이스 환경 조사해서 제일 적합한 하네스 혹은 멀티 에이전트 오케스트레이션 체계 오픈소스 찾아달라고 해보세요
이 제안은 「어떤 하네스가 제일 좋은가」라는 질문 자체가 성립하지 않으며, 답은 각자의 작업 환경 안에서 찾아야 한다는 관점을 담고 있는 것으로 보인다. 힉스필드처럼 하네스가 미리 준비된 도구, 데빈처럼 자체 하네스에 종속되는 도구, 그리고 워크스페이스에 맞춰 오픈소스를 새로 찾는 방식까지 세 갈래의 접근이 한 시간 안에 나란히 오갔다는 점은, 이 커뮤니티가 하네스 선택을 단일 기준이 아니라 작업 맥락에 따라 다층적으로 판단하고 있다는 뜻으로 읽힌다.
전날 같은 방에서는 데빈의 SWE-2 모델 자체의 성능(Kimi K3 기반, 비전 인식 지원 여부)을 놓고 오퍼스5보다 조금 아래라는 평가와 자주 끊겨 쓰기 어렵다는 불만이 오갔다. 하루 뒤인 오늘은 특정 모델의 성능 평가에서 한 걸음 물러나, 하네스라는 틀 자체를 워크스페이스에 맞춰 고르는 방법론으로 논의의 층위가 옮겨간 모습이다.
이 화두에는 16명이 참여해 41건의 메시지를 남겼다.