과학 코딩 에이전트도 절반을 넘지 못했다
20개 과학 분야의 실제 저장소를 대상으로 한 SWE-bench Science의 구성과 코딩 에이전트의 성능 한계, 평가의 의미를 정리합니다.
이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준
과학 소프트웨어를 고치는 코딩 에이전트의 능력을 재는 새로운 기준이 제시됐다. 2026년 8월 20일 발표된 논문은 SWE-bench Science를 소개하고, 현재 평가된 최고 성능 조합조차 과제의 절반 이상을 해결하지 못했다고 보고했다.1
무엇이 달라졌나
SWE-bench Science는 20개 과학 분야의 GitHub 저장소 98곳에서 가져온 119개 과제로 구성된 저장소 수준 벤치마크다.2 과제를 이슈 기반, 전문가 탐색, 엔지니어링 통합의 세 유형으로 나눠 과학 소프트웨어 작업을 평가한다.
평가 결과, 가장 높은 성능을 보인 Claude Code와 Opus-5(max) 조합도 pass@1 50%에 미치지 못했다.1 이는 평가된 범위에서 에이전트가 단 한 번의 시도로 정확한 수리를 완성하는 능력에 여전히 큰 공백이 있음을 보여준다.
배경
일반적인 소프트웨어 수정과 달리 과학 소프트웨어 작업에는 코드 탐색과 시스템 통합뿐 아니라 해당 분야의 지식과 추상화를 함께 다뤄야 하는 경우가 있다. 논문의 분석에서는 과학 지식이나 추상화의 부족, 잘못된 탐색과 표면적인 수정, 불완전한 수리 범위, 시스템 통합 실패, 관찰한 사례를 넘어 과학 지식을 일반화하지 못하는 문제가 반복적으로 나타났다.
이 벤치마크는 단일 함수나 짧은 코드 조각이 아니라 실제 저장소 수준의 과제를 다룬다. 따라서 결과는 코드 생성 능력만이 아니라 문제 이해, 탐색, 수정 범위 설정과 통합까지 이어지는 작업 흐름을 함께 비춘다.
왜 중요한가
119개 과제가 98개 저장소와 20개 과학 분야에 걸쳐 있다는 점은 과학 소프트웨어 엔지니어링을 하나의 좁은 분야나 소수 프로젝트의 사례로만 평가하지 않도록 한다.2 동시에 최고 성능이 pass@1 50% 미만이라는 결과는 과학 연구용 코드에서 에이전트의 결과를 검토 없이 받아들이기 어렵다는 신호다.1
실패 원인 분석도 중요하다. 에이전트가 단순히 코드를 덜 잘 작성해서 실패하는 것이 아니라, 관련 지식을 잘못 적용하거나 수정 범위를 충분히 넓히지 못해 실패할 수 있기 때문이다. 논문에 정리된 대응 실험에서는 근거가 과제와 잘 맞는 과학 정보가 평균 성능과 토큰 효율을 높일 수 있었지만, 맞지 않는 지침은 고착을 일으켰다. 과학 지식을 더 많이 제공하는 것만으로 정확한 수리가 보장되는 것은 아니라는 뜻이다.
한계와 남은 질문
현재 맥락에는 개별 에이전트별 전체 점수표, 과제 유형별 성공률, 저장소와 과학 분야별 난이도 차이가 포함돼 있지 않다. 따라서 어떤 종류의 과학 작업에서 성능 저하가 가장 큰지, 50% 미만이라는 결과가 특정 도구나 모델 구성에 얼마나 좌우되는지는 여기서 판단할 수 없다.
또한 119개 과제가 실제 과학 소프트웨어 개발 전체를 얼마나 대표하는지, 과제별 채점 기준이 부분적으로 유효한 수리를 어떻게 다루는지, 더 많은 과학 지식이나 새로운 탐색 전략이 결과를 얼마나 개선할지도 남은 질문이다. 후속 비교에서는 최종 성공률뿐 아니라 탐색 오류, 수정 범위 누락, 통합 실패를 분리해 측정할 필요가 있다.
관련 지식
이 결과는 [[topic:ai/agents|AI 에이전트]], [[topic:ai/benchmarks|벤치마크와 평가]], [[topic:ai/scientific-ai|과학 AI]]를 잇는 사례다. 대상 자체는 [[benchmark:swe-bench-science|SWE-bench Science]]이며, 이를 소개한 연구는 [[paper:swe-bench-science|SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?]]다.
출처
각주
-
「SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?」, https://arxiv.org/abs/2608.19799 — 최고 성능 에이전트의 pass@1 결과. ↩ ↩2 ↩3
-
「SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?」, https://arxiv.org/abs/2608.19799 — 벤치마크의 과제·저장소·과학 분야 구성. ↩ ↩2
- 이전
- 과학 분야의 코딩 에이전트 역량을 해당 구성으로 측정한 공개 벤치마크 논문이 제시되지 않았다.
- 현재
- 과학 소프트웨어 엔지니어링을 저장소 수준의 119개 과제로 측정하는 SWE-bench Science 논문이 공개됐다.
관련 지식
benchmark:swe-bench-science
- described_inpaper:swe-bench-science신뢰도 99%마지막 검증 2026-08-24