로봇을 움직이는 제어 정책을 학습할 때는 수백만 번의 시행착오가 필요합니다. 학습한 모델로 원하는 동작을 수행하는지 반복해서 검증해야 하는데, 실제 로봇으로 이를 반복하면 시간이 오래 걸리고 비용이 크며 로봇이 파손될 위험이 있습니다. 그래서 로봇 개발팀은 시뮬레이션에서 학습하고 실제 로봇에서 검증하는 Sim-to-Real 접근법을 사용합니다. 하지만 시뮬레이션에서 수많은 시행착오를 거치고 사전 학습된 모델을 로봇 데이터로 미세 조정하는 작업은 […] ||
로봇을 움직이는 제어 정책을 학습할 때는 수백만 번의 시행착오가 필요합니다. 학습한 모델로 원하는 동작을 수행하는지 반복해서 검증해야 하는데, 실제 로봇으로 이를 반복하면 시간이 오래 걸리고 비용이 크며 로봇이 파손될 위험이 있습니다. 그래서 로봇 개발팀은 시뮬레이션에서 학습하고 실제 로봇에서 검증하는 Sim-to-Real 접근법을 사용합니다.
하지만 시뮬레이션에서 수많은 시행착오를 거치고 사전 학습된 모델을 로봇 데이터로 미세 조정하는 작업은 모두 GPU 클러스터가 필요하고, GPU 서버를 구매하여 운영하는 일 자체가 새로운 병목이 됩니다. 즉, 강화학습(Reinforcement Learning, RL)과 모방학습 (Imitation Learning, IL) 접근법 모두 학습용 컴퓨팅 자원, 시뮬레이션 환경, 엣지 추론 환경이 필요합니다.
이 글은 핸즈온 워크숍 “From Training to Edge: Physical AI on AWS“를 바탕으로 Physical AI 모델 학습 파이프라인을 구축하는 과정을 AWS에서 구성하는 방법을 설명합니다. VLA(Vision-Language-Action) 트랙에서는 Amazon SageMaker AI의 Amazon SageMaker Pipelines로 NVIDIA Isaac GR00T 모델을 SO-101 로봇 팔 데이터셋에 맞게 미세 조정(fine-tuning)하고 NVIDIA Isaac Lab에서 폐루프(closed-loop) 평가를 수행한 뒤 AWS IoT Greengrass로 배포합니다.
강화학습(RL) 트랙은 PPO(Proximal Policy Optimization) 알고리즘으로 Isaac Lab과 MuJoCo에서 SO-101 로봇 팔의 Reach / Lift 작업 정책을 학습합니다. 이 글에서 Amazon SageMaker HyperPod의 Slurm 구성을 중심으로 다루며 Amazon Elastic Kubernetes Service(Amazon EKS)를 사용하는 구성도 소개합니다. 인프라는 AWS Cloud Development Kit(AWS CDK)로 정의되어 있고 실습 코드는 aws-physical-ai-recipes 저장소에서 확인할 수 있습니다.
전체 파이프라인 한눈에 보기
그림 1. 전체 워크샵 파이프라인
Physical AI 모델을 만드는 방법은 두 가지입니다. 범용 VLA 모델을 자기 로봇 데이터로 fine-tuning하는 VLA 트랙과, 보상 함수만으로 단일 태스크 정책을 처음부터 학습하는 강화학습(RL) 트랙입니다. 학습 방법은 달라도 두 트랙은 같은 인프라 위에서 움직이며 시뮬레이션 워크스테이션, S3 저장소, CDK 정의를 공유합니다.
그림 2. VLA 트랙의 시뮬레이션 평가 예시. GR00T 모델이 자연어 명령을 받아 SO-101 팔로 오렌지를 집어 접시에 올립니다.
그림 3. RL 트랙 실습 결과(Isaac Lab). PPO로 학습한 SO-101 Reach/Lift 정책이 MuJoCo와 Isaac Lab에서 실행됩니다.
1. 학습 준비
VLA: SO-101 팔을 텔레오퍼레이션으로 조작해 LeRobot 형식 데이터셋(leisaac-pick-orange)을 만들어 S3에 업로드
RL: 태스크와 보상 함수를 정의(SO-101 Reach/Lift, Unitree H1 보행 등)
2. 학습
학습 인프라 선택: 작업 단위로 시작·종료하는 fine-tuning은 SageMaker Training Job/Pipelines를, 수일~수주 반복 실험은 HyperPod 클러스


