MARS는 경쟁 프로그래밍을 전문가 에이전트 릴레이로 풀었다
검색으로 선택한 알고리즘 전문가들이 풀이를 인계하는 MARS의 구조와 CodeContests 성능, 해석상의 한계를 정리합니다.
이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준
경쟁 프로그래밍 문제를 하나의 범용 모델이 처음부터 끝까지 푸는 대신, 검색으로 선택한 알고리즘 전문가 에이전트들이 풀이를 이어받는 MARS가 발표됐다. 논문은 이 릴레이가 C++17 해답을 작성하고 시험하며, 필요한 경우 수정한 뒤 다음 전문가에게 넘기는 프롬프트 기반 구조라고 설명한다. 다만 현재 제공된 근거만으로는 각 구성 요소가 성능에 얼마나 기여했는지까지 판단할 수 없다.
무엇이 달라졌나
MARS는 문제와 관련된 알고리즘 전문가를 검색으로 선택하고, 여러 전문가가 순차적으로 작업을 인계하도록 구성됐다. 단일 에이전트 내부의 긴 추론에만 의존하지 않고, 서로 다른 전문 역할을 하나의 풀이 파이프라인으로 조립했다는 점이 핵심이다.
보고된 결과에 따르면 Gemma 4를 사용한 MARS는 CodeContests 테스트 분할에서 0.624 ± 0.006의 통과율을 기록했다. 과제당 기록된 파이프라인 단계 수는 2.3개였다.1
배경
[[AI 에이전트|topic:ai/agents]]는 일반적으로 추론과 행동, 관찰을 여러 턴에 걸쳐 반복한다. MARS 역시 여러 단계의 작업을 사용하지만, 제공된 문맥에서 강조되는 방식은 유휴 시간에 보조 추론을 수행하는 병렬화가 아니라 전문 에이전트 사이의 릴레이다.
[[검색 증강 생성|topic:ai/rag]]은 외부 문서를 찾아 모델 생성에 근거를 제공한다. MARS에서는 검색이 최종 답변의 근거 문서를 제시하는 용도라기보다, 문제에 맞는 알고리즘 전문가를 선택해 릴레이를 구성하는 데 사용된다. 구체적인 검색 자료의 범위와 선택 기준은 현재 문맥만으로는 알 수 없다.
왜 중요한가
이 결과는 경쟁 프로그래밍 성능을 모델 크기나 단일 추론 경로뿐 아니라, 전문 역할의 선택과 작업 인계 구조를 통해 개선할 가능성을 보여준다. 특히 해답 작성, 시험, 수정, 인계를 분리한 구조는 최종 정답 여부만이 아니라 풀이 과정의 어느 단계에서 실패했는지를 살펴볼 여지를 만든다.
[[벤치마크와 평가|topic:ai/benchmarks]] 관점에서는 통과율과 함께 과제당 파이프라인 단계 수가 제시됐다는 점도 눈에 띈다. 이는 정답률만 보고된 경우보다 풀이 과정의 길이를 일부 파악하게 해준다. 그러나 단계 수만으로 계산 비용, 지연 시간, 토큰 사용량 또는 운영 효율을 판단할 수는 없다.
한계와 남은 질문
제공된 근거에는 Gemma 4 기반 CodeContests 테스트 결과 하나만 포함돼 있다. 단일 에이전트 방식이나 다른 릴레이 구성과의 비교 수치, 통계 산출 방법, 실패 유형별 분석은 알 수 없다. 0.624 ± 0.006이라는 값이 다른 모델과 데이터 조건에서도 유지되는지도 이 문맥만으로 판단할 수 없다.
검색으로 선택된 전문가의 정확한 정의, 전문가 수, 인계 기준, 시험과 수정의 종료 조건도 제시된 정보에는 없다. 또한 검색된 자료가 부정확하거나 오염됐을 때 릴레이 전체가 어떤 영향을 받는지, 여러 전문가의 판단이 충돌할 때 어떻게 조정하는지는 남은 질문이다.
관련 지식
관련 항목으로는 논문 [[MARS: Multi-Specialist LLM Relay System for Competitive Programming|paper:mars-multi-specialist-llm-relay-system-for-competitive-programming]], 프레임워크 [[MARS|technology:mars]], 평가에 사용된 [[CodeContests|benchmark:codecontests]]가 있다. 주제별로는 [[AI 에이전트|topic:ai/agents]], [[검색 증강 생성|topic:ai/rag]], [[벤치마크와 평가|topic:ai/benchmarks]]와 연결된다.
출처
- 「MARS: Multi-Specialist LLM Relay System for Competitive Programming」, arXiv, 2026년 8월 24일. https://arxiv.org/abs/2608.23918
각주
-
MARS의 CodeContests 테스트 통과율과 과제당 기록된 파이프라인 단계 수에 관한 논문의 보고. ↩
- 이전
- 공급된 Wiki는 에이전트의 유휴 시간 병렬 추론과 일반적인 검색 증강 생성을 각각 설명했다.
- 현재
- 검색으로 선택한 분야별 전문가들이 경쟁 프로그래밍 풀이를 작성·시험·수정·인계하는 MARS 릴레이가 제안됐다.
관련 지식
technology:mars
- described_inpaper:mars-multi-specialist-llm-relay-system-for-competitive-programming신뢰도 100%마지막 검증 2026-08-27