SwarmBench가 묻는 것: 모델 성능과 군집 지휘 성능을 왜 따로 봐야 하는가 | DAKER 커뮤니티
에이전트를 여러 개 붙여 돌리는 실험이 늘수록, 한 가지 점수를 어떻게 읽어야 하는지부터 다시 따져볼 필요가 있습니다. 모델이 혼자 문제를 잘 푸는 능력과, 여러 서브에이전트를 나눠 쓰며 지휘하는 능력은 같은 항목이 아니기 때문입니다.
2026년 8월 31일 공개된 SwarmBench는 바로 이 지점을 겨냥합니다. 대형언어모델이 에이전트 군집의 오케스트레이터로 얼마나 잘 작동하는지 따로 재려는 벤치마크입니다. 오늘 글은 이 벤치의 사실 관계를 정리하면서, 한 모델의 점수와 군집 지휘 점수를 같은 표에서 섞어 읽지 말아야 하는 이유를 살펴봅니다.
논문은 2026년 8월 31일 arXiv에 올라왔습니다. 초록은 arXiv:2608.30661에서 볼 수 있고, 영문 제목은 SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators?입니다. 저자는 Jinshan Gao, Zhuoran Jin(corresponding), Tianyi Men, Kang Liu, Jun Zhao이며 CASIA / UCAS 소속입니다. PDF는 같은 번호의 pdf, 코드는 GitHub ying1973/SwarmBench에 공개되어 있습니다.
SwarmBench는 무엇을 따로 재는가
SwarmBench의 질문은 단순한 모델 성능 비교가 아닙니다. 핵심은 대형언어모델이 에이전트 군집의 메인 오케스트레이터로서 얼마나 잘 분해하고, 위임하고, 다시 모아 답을 만드는가입니다.
한 모델 점수와 군집 지휘 점수는 같은 줄에서 읽기보다 분리해 보는 것이 좋습니다.
이 벤치는 과제 8개, 샘플 400개로 구성되며 각 과제는 50개 샘플을 가집니다. 범주는 분해, 위임, 집계의 세 가지입니다. 메인 에이전트는 도구를 직접 호출할 수 없고 혼자 답을 내는 방식도 막혀 있습니다. 여기에 맥락 일부까지 가려집니다. 대신 서브에이전트는 모델 풀에서 고를 수 있습니다. 이 설정이 SwarmBench의 성격을 분명하게 만듭니다.
분해·위임·집계, 세 범주로 보는 과제 구성
분해 범주에는 Batch Download, Multi-Text Understanding, MATH가 들어갑니다. 위임 범주에는 MPA, RCA, Treasure Hunt가 포함됩니다. 집계 범주에는 Long-Text Generation, Wide Search가 배치됩니다.
이 구분은 단순한 분류표가 아니라, 어디서 실패가 나는지를 읽는 기준이 됩니다. 메인 에이전트가 직접 도구를 쓰거나 혼자 해결하지 못하도록 막아 둔 만큼, 점수는 오케스트레이션 자체를 더 강하게 반영합니다.
메인 에이전트에게 도구를 주지 않고, 일부 맥락도 가린 채 지휘만 맡긴다는 점이 이 벤치의 핵심입니다.
이 때문에 팀 단위 실험이나 해커톤 환경에서도 README나 평가 문서에 먼저 적어야 할 것은 모델 이름보다 설정입니다. 메인이 전부 하는 구조인지, 아니면 메인이 위임만 하는 구조인지가 결과 해석을 바꿉니다.
평균 점수는 출발점일 뿐입니다
AVG 기준으로는 GPT-5.4가 50.49로 8과제 중 6개에서 최고입니다. Claude-Sonnet-4-6은 43.51, Qwen3.5-397b-a17b는 40.62, Deepseek-v3.2는 40.38, GLM-5.1은 40.30, Kimi-k2.5는 32.81입니다. 단일 에이전트 GPT-5-mini는 24.41입니다.
군집 설정 점수와 단일 에이전트 점수를 같은 순위표에 섞으면 해석이 흐려집니다.
이 숫자들이 보여주는 것은 단순히 어떤 모델이 더 높다는 사실만이 아닙니다. 오케스트레이터로서의 성능과 단일 에이전트 성능은 비교선이 다르다는 점이 더 중요합니다. 단일 에이전트 24.41과 군집 최고 50.49를 나란히 적는 일은 의미가 있지만, 이를 곧바로 같은 종류의 리더보드처럼 읽는 것은 적절하지 않습니다.
DACON이나 DAKER처럼 서브에이전트를 나눠 돌리는 환경에서는 오케스트레이터 프롬프트, Worker 모델 풀, 단일 모델 기준선을 한 표에 모두 넣더라도 항목을 분리해 적는 편이 좋습니다.
과제별 점수는 평균보다 더 많은 것을 말합니다
GPT-5.4는 MATH 82.97, Batch Download(BD) 87.84, MPA 77.17, Wide Search(WS) 38.67을 기록했습니다. 반면 RCA는 10.00, Treasure Hunt(TH)는 10.33입니다.
평균이 높아도 특정 과제에서는 낮은 축이 분명히 남아 있습니다.
이 점은 중요합니다. 높은 과제만 골라 오케스트레이션이 완성됐다고 말하기 어렵기 때문입니다. 특히 집계나 위임이 얽힌 과제에서 약점이 드러나면, 평균 점수만으로는 실제 운영 성능을 설명하기 어렵습니다.
초록은 비용과 성능이 선형 관계가 아니라고 적습니다. 병렬화율과 병렬화 이득도 같지 않습니다. 또한 집계가 자주 가장 어렵다고 경고합니다. 서브에이전트 수를 늘리는 것만으로 성능이 자연스럽게 따라오지 않는다는 뜻입니다.
Treasure Hunt와 Batch Download가 보여주는 구조적 힌트
Treasure Hunt는 9×9 지도에서 구리·은·금 상자가 각각 100·200·300 점수를 갖습니다. 메인 에이전트는 고정되어 있고, 정찰과 운반 서브에이전트를 생성합니다. Batch Download는 샘플당 평균 파일 11.44개이며 download F1로 평가합니다.
이 두 과제는 군집 구조를 어떻게 나눌지 생각할 때 참고가 됩니다. 지휘, 정찰, 운반처럼 역할을 분리하는 방식이나, 파일 파이프라인처럼 여러 단계를 나눠 평가하는 방식은 실제 팀 실험에도 옮겨 보기 좋습니다. 다만 원문에 없는 통과율이나 추가 성능 수치를 덧붙여 해석할 필요는 없습니다.
SwarmExp는 왜 궤적 재사용을 강조하는가
SwarmExp는 궤적에서 스킬·트릭·모델 카드를 뽑아 재생합니다. Agent Swarm 대비 Multi-Text Understanding(MTU) 49.07(+0.25), RCA 16.42(+6.42), Long-Text Generation(LTG) 54.65(+6.46), WS 41.59(+2.92)입니다.
제거 실험에서는 모델 카드를 뺐을 때 평균 하락이 가장 커 -2.49를 보입니다. 이는 서브에이전트 선택 근거를 남기는 일이 단순한 기록이 아니라 재현성과 성능 유지에 연결된다는 뜻으로 읽을 수 있습니다.
서브에이전트 선택 근거를 남기지 않으면 궤적 재생의 힘이 약해집니다.
따라서 오케스트레이터 지시, 서브에이전트 풀, 모델 카드 URL을 함께 남기는 방식은 실험 기록을 정리할 때 유용합니다. 중요한 것은 수치를 과장해 옮기는 것이 아니라, 어떤 형식으로 남겼는지를 분명히 하는 일입니다.
빌더 팀이 옮겨 볼 만한 점검 포인트
SwarmBench를 사내 평가나 해커톤 운영에 참고할 때는 먼저 메인 에이전트에게 도구를 막은 채 위임만 시키는 스모크 테스트를 두는 것이 좋습니다. 맥락 일부를 가린 설정도 함께 적어 두면 해석이 쉬워집니다.
또한 비용, 병렬화율, 병렬화 이득을 따로 적는 편이 좋습니다. 초록이 비용과 성능의 비선형성을 짚고 있는 만큼, 성능 수치만 올려놓으면 실제 운영 판단에 필요한 정보가 빠집니다.
분해 과제인 Batch Download, Multi-Text Understanding, MATH와 위임 과제인 MPA, RCA, Treasure Hunt, 집계 과제인 Long-Text Generation, Wide Search를 서로 다른 열로 나눠 보는 방식도 유용합니다. 특히 집계가 자주 가장 어렵다는 경고는 일정 후반에만 몰아넣지 말아야 할 이유가 됩니다.
낮은 점수가 나온 축은 실패 태그로 따로 보는 편이 좋습니다. 예를 들어 RCA 10.00, TH 10.33, WS 38.67 같은 값은 Worker 코드 버그와 오케스트레이션 실패를 구분해 보는 출발점이 됩니다.
이 글이 말하지 않는 것
이 글은 단일 에이전트 코딩 리더보드를 소개하는 글이 아닙니다. 메인은 도구 호출과 단독 답변이 막힌 오케스트레이터 평가이며, GPT-5-mini 24.41은 단일 에이전트 참고선입니다.
또한 서브에이전트를 늘리면 점수가 선형으로 오른다는 뜻도 아닙니다. 초록은 비용과 성능이 선형이 아니고, 병렬화율과 병렬화 이득도 같지 않다고 적습니다.
모든 과제가 50점대라는 주장도 아닙니다. GPT-5.4 역시 RCA 10.00, TH 10.33처럼 낮은 지표를 보입니다. 모델 카드 없이도 궤적 재생이 충분하다는 뜻도 아닙니다. 제거 실험에서 평균 -2.49로 가장 큰 하락이 나타났기 때문입니다.
참고 자료
arXiv:2608.30661 — SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators? (2026-08-31)
PDF
GitHub ying1973/SwarmBench
여러분의 팀에서는 단일 모델 성능과 오케스트레이터 성능을 어떤 방식으로 분리해 기록하고 계신가요?