JIT-Agent, 에이전트 하네스 자체를 진화의 대상으로 삼다
과제에 맞춰 에이전트 하네스를 생성·진화시키는 JIT-Agent의 접근과 두 벤치마크에서 보고된 성능 차이, 해석의 한계를 정리합니다.
이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준
2026년 8월 26일 발표된 「JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution」은 에이전트의 성능을 언어 모델 자체뿐 아니라, 모델이 과제를 수행하도록 둘러싼 하네스의 설계 문제로 확장한다. 논문은 과제에 맞는 하네스를 생성하고 수리하며 진화시키는 JIT-Agent를 제시하고, 두 에이전트 벤치마크에서 JIT-Agent를 보조 모델로 결합한 구성의 성능 향상을 보고했다.
무엇이 달라졌나
JIT-Agent는 기성 에이전트형 언어 모델을 지원하는 과제 적응형 하네스를 즉시 생성·수리·진화시키는 모델이다. 논문은 에이전트 하네스를 조합 가능한 산출물로 정식화하고, 고정된 실행 틀을 그대로 사용하는 대신 과제에 맞춰 하네스를 변화시키는 접근을 제시했다.
보고된 비교에서 JIT-Agent를 하네스 보조 모델로 사용한 DeepSeek-V4-Flash는 DeepSearchQA에서 GPT-5.6을 9.1점 앞섰다.1 OdysseyBench에서도 같은 구성이 GPT-5.6보다 4.3점 높은 결과를 기록했다.2
배경
AI 에이전트는 일반적으로 여러 턴에 걸쳐 추론하고, 행동한 뒤, 환경의 관찰을 받아 다음 단계를 결정한다. 이 과정의 성능은 기반 모델뿐 아니라 도구 호출, 상태 관리, 관찰 처리, 단계 구성 등 모델을 둘러싼 하네스에도 영향을 받을 수 있다. JIT-Agent 논문은 이 하네스를 고정된 부속물이 아니라 생성과 수정의 대상이 되는 산출물로 다룬다.
에이전트 평가는 최종 점수만으로 구성 차이의 원인을 충분히 설명하기 어렵다. 관련 평가 연구인 TraceML의 맥락에서도 인간과 에이전트의 작업 과정을 버전별로 기록해 행동과 점수 효과를 연결하려는 시도가 소개돼 있다. 이런 관점은 하네스가 어떤 행동 경로를 만들었는지까지 살펴볼 필요가 있음을 보여준다.
왜 중요한가
이번 결과의 핵심은 더 강한 기반 모델을 만드는 것과 별개로, 기존 모델이 과제를 수행하는 실행 구조를 적응시키는 방식에서도 성능 차이가 나타날 수 있다는 점이다. 특히 서로 다른 두 벤치마크에서 JIT-Agent 보조 구성이 GPT-5.6보다 높은 점수를 기록했다는 보고는 하네스 설계가 독립적인 최적화 대상으로 연구될 이유를 제공한다.12
또한 하네스를 조합 가능한 산출물로 다루면 생성, 수리, 진화를 각각 명시적인 작업으로 검토할 수 있다. 이는 에이전트 개선을 단일 프롬프트 수정이나 기반 모델 교체에만 한정하지 않고, 과제별 실행 구조의 변화까지 포함하는 방향을 제시한다.
한계와 남은 질문
제공된 근거만으로는 DeepSearchQA와 OdysseyBench의 세부 과제 구성, 점수 산식, 실행 예산, 비교 런타임 조건을 확인할 수 없다. 9.1점과 4.3점의 차이가 어떤 세부 능력에서 비롯됐는지, 반복 평가에서 얼마나 안정적인지, 하네스 생성과 진화에 추가로 든 계산량이 얼마인지도 알 수 없다.
두 결과는 JIT-Agent를 사용한 특정 모델·하네스 조합의 비교다. 따라서 다른 기반 모델이나 실제 운영 과제에서도 같은 폭의 향상이 재현된다고 일반화할 수 없다. 생성된 하네스의 안전성, 오류 발생 시 수리 방식, 사람이 결과를 감사할 수 있는 정도 역시 남은 질문이다.
관련 지식
관련 주제는 AI 에이전트와 벤치마크 평가다. 연결되는 개체로는 JIT-Agent, 논문 「JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution」, DeepSearchQA, OdysseyBench가 있다. 병렬 추론을 다루는 Second Thought나 과정 중심 평가를 다루는 TraceML의 사례와 함께 보면, 에이전트 연구가 기반 모델의 답변 품질뿐 아니라 추론 배치, 실행 구조, 작업 과정의 측정으로 넓어지고 있다는 맥락에서 이해할 수 있다.
출처
- 「JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution」, arXiv, 2026년 8월 26일: https://arxiv.org/abs/2608.25593
각주
- 이전
- 기존 Wiki 맥락은 에이전트의 병렬 추론과 개발 과정 중심 평가를 다뤘다.
- 현재
- 과제별 에이전트 하네스를 즉시 생성·수리·진화시키는 JIT-Agent 모델과 벤치마크 결과가 제시됐다.
관련 지식
model:jit-agent
- evaluated_onbenchmark:deepsearchqa신뢰도 99%마지막 검증 2026-08-27
- evaluated_onbenchmark:odysseybench신뢰도 99%마지막 검증 2026-08-27