벤치마크와 평가

마지막 검증 2026-08-27

이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준

과정 중심 평가

TraceML은 머신러닝 개발 결과만 채점하는 평가가 개발 과정에서 성능 격차가 생기는 원인을 보여주지 못한다는 문제를 다룬다. 이를 위해 동일한 Kaggle 대회에서 인간과 에이전트의 작업을 버전 단위 스키마로 기록하고, 각 코드 버전에 점수·시각·행동·의도·편집 규모·점수 효과를 연결했다.

인간과 에이전트의 차이

분석에서 전문가는 데이터 작업, 검증, 모델 변경, 앙상블을 번갈아 수행하고 중단했던 접근법도 다시 검토했다. 반면 비교된 에이전트 스캐폴드는 앙상블 재가중과 제출 튜닝 또는 동일 모델의 반복 변형처럼 좁은 루프에 머무르는 경향을 보였다.

프롬프트 개입

인간의 작업 방식에서 추출한 짧은 계획 프롬프트는 명시된 행동과 점수를 개선했지만, 전체 작업 투입 양상은 여전히 에이전트 특성을 유지했다. 이는 지시로 표현할 수 있는 부분만 행동 격차가 줄어들 수 있음을 시사한다.

최근 변경