강화학습

마지막 검증 2026-08-28

이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준

강화학습 기반 로봇 행동

Microduck는 물리 시뮬레이션에서 행동 정책을 학습한 뒤 실물 로봇에 배포하는 방식을 채택한다. 걷기, 앉고 일어서기, 차기, 물체 집기, 롤러스케이팅, 넘어진 뒤 일어나기 등 출고 시 제공되는 행동도 사용자가 다시 학습할 수 있다. SDK와 시뮬레이션, 강화학습 훈련 스택은 공개되어 새로운 행동을 만들고 공유할 수 있다.

데이터 규모에 따른 학습 안정화

WarpSAC 연구는 대규모 병렬 시뮬레이션이 오프폴리시 강화학습의 데이터 조건을 바꾼다고 본다. 데이터가 제한된 환경과 풍부한 환경에 서로 다른 정규화 및 Q 함수 구성을 적용하고, 두 조건 모두에서 오래된 표본의 가중치를 조절하는 Sample Weight Decay를 사용한다. 보고된 실험에서는 GPU 병렬 조작 환경에서 기존 방식보다 학습 효율과 성공률이 개선되었다.

최근 변경