ROBOTNESS
연구3분 분량ROBOTNESS 데스크대한민국

KAIST와 크래프톤 참여한 'FlashSAC', RSS 2026 최우수 논문상 수상, 휴머노이드 보행 학습 GPU 1장으로 20분

홀리데이로보틱스, KAIST, 크래프톤, 독일 다름슈타트공대, 스웨덴 KTH 등이 참여한 강화학습 기법 FlashSAC가 2026년 7월 시드니에서 열린 로봇공학 학회 RSS 2026에서 최우수 논문상을 받았다. 연구진은 RTX 5090 한 장으로 유니트리 G1의 평지 보행 정책을 약 20분 만에 학습했으며, 표준 기법인 PPO는 약 3시간이 걸렸다고 밝혔다.

요약

오프폴리시 강화학습 기법 FlashSAC가 2026년 7월 13~17일 호주 시드니에서 열린 로봇공학 학회 RSS(Robotics: Science and Systems) 2026에서 최우수 논문상(Outstanding Paper Award)을 받았다고 RSS 수상 페이지가 밝혔다. 연구진은 이 기법이 로봇 업계가 주로 쓰는 방식보다 휴머노이드 보행 제어기를 약 10배 빠르게, 소비자용 그래픽카드 한 장으로 학습시킨다고 설명했다.

연구진

저자 13명의 소속은 홀리데이로보틱스, KAIST, 크래프톤, 튜링(Turing Inc), 독일 다름슈타트공대, hessian.AI, 스웨덴 KTH 왕립공대, 독일인공지능연구소(DFKI), 독일로봇연구소(RIG)다. 다름슈타트공대 얀 페터스 교수, KTH 다니카 크라기치 교수, KAIST 주재걸 교수, Hojoon Lee 연구자가 시니어 저자로 참여했다. 논문은 2026년 4월 arXiv 프리프린트(2604.04539)로 먼저 공개됐고 코드는 깃허브 Holiday-Robot 조직에 올라 있다.

핵심 수치

연구진에 따르면 29자유도 유니트리 G1 휴머노이드의 평지 보행 학습에 FlashSAC는 약 20분, 로봇 보행 학습의 표준인 온폴리시 알고리즘 PPO는 약 3시간이 걸렸다. 거친 지형과 계단 오르기는 FlashSAC 약 4시간, PPO 약 20시간이었다. 모든 시간은 엔비디아 RTX 5090 한 장에서 측정했고, 학습된 정책은 시뮬레이션에서 실제 로봇으로 옮겨 검증했다.

GPU 기반 시뮬레이터 4종(IsaacLab, MuJoCo Playground, ManiSkill, Genesis)의 25개 과제에서 FlashSAC는 저차원 과제 15개에서 PPO와 비슷했고, 다지 손 조작과 휴머노이드 보행 등 고차원 과제 10개에서는 PPO를 크게 앞섰다. 사용한 시뮬레이션 스텝은 5천만으로 PPO의 2억보다 적었다. DeepMind Control Suite, MyoSuite, HumanoidBench 등 CPU 기반 40개 과제에서는 과제별 튜닝 없이 PPO, XQC, SimbaV2, TD-MPC2, MR.Q를 꾸준히 앞섰다고 연구진은 밝혔다. 프로젝트 페이지 기준 10개 시뮬레이터, 60개 이상 과제에서 검증했다.

기법 설명

로봇 강화학습은 크게 두 갈래다. PPO 같은 온폴리시 방식은 매번 경험을 버려 비효율적이지만 안정적이다. SAC(Soft Actor-Critic) 같은 오프폴리시 방식은 경험을 저장해 재사용하므로 효율적이어야 하지만 관절이 많은 로봇에서는 학습이 불안정해지기 쉽다. FlashSAC는 SAC의 재사용 장점을 살리면서 불안정성을 잡았다.

방법은 두 가지다. 첫째, 언어모델처럼 규모를 키웠다. 1,024개 병렬 시뮬레이션 환경, 통상 100만 개 대신 1천만 개 전이를 담는 리플레이 버퍼, 6층 250만 파라미터 신경망, 배치 크기 2,048, 데이터 1,024스텝당 2회라는 매우 적은 업데이트 횟수를 썼다. 둘째, 여러 정규화 계층으로 가중치와 내부 특징, 기울기의 크기를 제한해 학습이 불안정 영역으로 빠지지 않게 했다. 고정된 탐색 목표와 반복 노이즈는 로봇이 더 길고 매끄러운 동작을 시도하게 돕는다.

경쟁 구도

PPO는 예측 가능성 덕분에 대부분 휴머노이드 기업의 시뮬레이션 기반 보행 학습 표준으로 쓰여 왔다. TD-MPC2, SimbaV2, MR.Q 같은 빠른 대안은 벤치마크에서는 성과를 냈지만 실제 휴머노이드 적용 사례는 드물었다. FlashSAC는 이 간극을 실제 하드웨어에서 메웠다는 점을 내세운다. 사용된 시뮬레이터 중 엔비디아 IsaacLab은 휴머노이드 업체들이 널리 쓰는 학습 환경이어서 기존 개발 파이프라인에 바로 붙일 수 있다.

국내 업계에 주는 의미

한국 연구진이 로봇 학습 분야 최고 권위 학회의 최우수 논문을 공동으로 이끌었다는 점에서 의미가 크다. 게임사 크래프톤이 피지컬 AI 연구에 이름을 올린 것도 이례적이다. 학습 시간은 곧 엔지니어링 시간이다. 하루 걸리던 보행 제어기 학습이 20분으로 줄면 같은 주에 설계와 보상 함수, 하드웨어 변경을 훨씬 많이 시험할 수 있다. 클러스터 대신 GPU 한 장으로 가능하다는 점은 레인보우로보틱스 같은 국내 휴머노이드 업체와 대학 스핀오프, 스타트업의 진입 장벽을 낮춘다. 성과가 가장 큰 영역이 다지 손과 전신 휴머노이드 같은 고차원 문제라는 점도 업계 투자 방향과 맞아떨어진다.

위험 요인

수치는 연구진 자체 측정이고 '약'으로 표기된 근사치다. 학습 시간 비교는 PPO를 얼마나 잘 튜닝했는지에 따라 달라지며, 논문에서 두 기법의 스텝 예산도 다르다. 실제 로봇 검증은 유니트리 G1 한 기종, 보행 과제에 한정됐다. 접촉이 많은 실제 조작 과제에서도 속도 이점이 유지되는지는 아직 입증되지 않았다.

ROBOTNESS 분석

FlashSAC는 오프폴리시 강화학습이 로봇 몸체 학습의 업계 표준인 PPO를 대체할 수 있다는 지금까지 가장 강한 근거이며, 경쟁력의 축을 연산 예산에서 반복 속도로 옮긴다.

근거는 실제 하드웨어에서 평지 보행 학습 시간을 약 9분의 1, 거친 지형은 약 5분의 1로 줄였고, 성과가 고차원 과제에 집중됐으며, 과제별 튜닝 없이 60개 이상 과제를 다뤘고, 이를 학계 최고 권위의 상이 인정했다는 점이다.

가장 강한 반론은 PPO의 장점이 속도가 아니라 예측 가능성이었다는 것이다. 여러 정규화 기법이 얽힌 오프폴리시 방식은 로봇이나 보상, 시뮬레이터를 바꿀 때 취약할 수 있다.

강세 시나리오: 코드가 공개된 만큼 휴머노이드와 로봇 손 업체들이 수개월 안에 FlashSAC로 갈아타 개발 주기를 줄이고 GPU 지출을 아낀다. 데이터 재사용이 가장 중요한 실제 로봇 미세조정으로도 확장된다.

약세 시나리오: PPO를 제대로 튜닝한 재현 실험에서 이점이 줄고, 기업들은 양산 제어기에 PPO를 계속 쓴다. 실제 조작 과제 성과가 시뮬레이션에 못 미친다.

주목할 신호:

  • CoRL 2026 등에서 다른 휴머노이드로 한 독립 재현 결과
  • IsaacLab이나 MuJoCo Playground 공식 예제에 FlashSAC가 포함되는지 여부
  • 2026년부터 2027년 초까지 휴머노이드 업체 기술 보고서에 FlashSAC가 언급되는지 여부
FlashSAC와 PPO의 유니트리 G1 학습 시간 비교(RTX 5090 1장)
  • 평지 보행
    FlashSAC(분)
    20
    PPO(분)
    180
    PPO/FlashSAC(배)
    9
  • 거친 지형과 계단
    FlashSAC(분)
    240
    PPO(분)
    1200
    PPO/FlashSAC(배)
    5

연구진이 밝힌 근사 학습 시간(약 20분 대 약 3시간, 약 4시간 대 약 20시간). 배수 = PPO 시간 / FlashSAC 시간. GPU 시뮬레이터 벤치마크에서 FlashSAC는 5천만 스텝, PPO는 2억 스텝 사용.

2026년 10월 1일 기준

핵심 사실
수상
RSS 2026 최우수 논문상
학회
2026년 7월 13~17일, 호주 시드니
프리프린트
arXiv 2604.04539(2026년 4월)
로봇
유니트리 G1, 29자유도
평지 보행
약 20분(PPO 약 3시간)
거친 지형과 계단
약 4시간(PPO 약 20시간)
하드웨어
엔비디아 RTX 5090 1장
검증 범위
10개 시뮬레이터, 60개 이상 과제
국내 참여
KAIST, 크래프톤
출처
ROBOTNESS 인텔리전스
  1. 01

    왜 중요한가

    현재 양산되는 휴머노이드 보행 제어기 대부분은 대규모 병렬 시뮬레이션에서 PPO로 학습된다. 효율보다 안정성을 택한 결과이며, 이 선택이 기업의 GPU 예산과 개발 일정을 규정해 왔다. FlashSAC는 데이터를 재사용하면서도 전신 휴머노이드에서 더 빠르고 안정적인 방법을 공개 코드와 함께 내놓아 그 전제를 흔들었다.

    수상 자체도 신호다. RSS는 올해 최우수 논문을 한 편만 선정했고, 하드웨어나 시스템 논문이 아닌 학습 알고리즘 논문을 골랐다. 학계가 로봇 몸체 학습의 효율을 핵심 병목으로 본다는 뜻이다.

  2. 02

    경쟁사 비교

    강화학습 안에서 FlashSAC의 경쟁자는 SimbaV2, XQC, TD-MPC2, MR.Q와 GPU 시뮬레이터의 PPO다. TD-MPC2 같은 모델 기반 기법은 스텝당 연산을 더 쓰며 표본 효율을 높이는 반면 FlashSAC는 값싼 대규모 배치 업데이트에 건다.

    산업 차원에서 빠른 강화학습의 대안은 시연 데이터 기반 학습과 대형 VLA다. 둘은 보완 관계로, VLA는 작업 이해를, 강화학습 제어기는 균형과 접촉을 맡는다. 원격조작 데이터에만 기대는 기업보다 둘을 결합하는 기업이 유리해진다.

  3. 03

    밸류에이션 맥락

    FlashSAC는 직접 가격이 붙는 성과는 아니지만 비용에서 가치가 드러난다. 거친 지형 학습에 GPU 약 20시간이 들던 것이 약 4시간으로 줄면 같은 장비로 약 5배 많은 실험을 돌릴 수 있다.

    투자 관점에서는 보행 학습을 연산 규모로 밀어붙이던 기업의 해자가 약해지고 엔지니어링이 강한 소규모 팀이 유리해진다. 크래프톤의 참여는 게임사 같은 비로봇 자본이 피지컬 AI 연구로 들어오고 있음을 보여준다.

  4. 04

    공급망 파급

    이 기법은 소비자급 GPU인 엔비디아 RTX 5090 한 장과 IsaacLab, MuJoCo Playground, ManiSkill, Genesis 같은 범용 시뮬레이터에서 돌아간다. 엔비디아 의존은 그대로지만 수요가 데이터센터 클러스터에서 워크스테이션으로 옮겨갈 수 있다.

    로봇 측면에서는 저가에 널리 보급된 유니트리 G1이 검증 플랫폼이 되면서 유니트리의 연구용 표준 지위가 더 굳어진다. 고차원 손의 학습이 빨라지면 제어 복잡성이 걸림돌이던 다지 로봇 손 수요도 늘 수 있다. 국내 부품 업체에는 학습 친화적인 액추에이터 데이터 제공이 차별화 요소가 될 수 있다.

  5. 05

    지켜볼 신호

    CoRL 2026과 arXiv 프리프린트에서 나올 독립 재현, 특히 실제 로봇 손 조작 결과를 지켜봐야 한다. 엔비디아나 MuJoCo 팀이 FlashSAC를 공식 예제에 넣으면 사실상 기본 선택지가 된다.

    코드를 호스팅하는 홀리데이로보틱스의 제품이나 투자 발표, KAIST와 크래프톤의 후속 연구도 관전 포인트다. 국내 휴머노이드 업체가 이 기법을 실제 제어기 개발에 도입하는지도 확인할 필요가 있다.

  6. 06

    애널리스트 시각

    명제: FlashSAC는 1년 안에 로봇 강화학습의 표준 비교 기준이 되고, 고차원 로봇의 일부 양산 파이프라인에서 PPO를 대체할 가능성이 높다. 확신도: 중간.

    속도 개선이 연구진 자체 측정의 근사치이고 실제 로봇 검증이 휴머노이드 한 기종의 보행에 국한돼 확신도를 중간으로 둔다. 공개 코드, 60개 이상 과제의 폭넓은 검증, RSS 심사위원회의 인정이 이 판단을 뒷받침한다.

  7. 07

    따져봐야 할 질문

    새 로봇으로 옮길 때 FlashSAC는 여러 정규화 선택에 얼마나 민감한가. 같은 스텝 예산으로 정교하게 튜닝한 PPO와 비교해도 속도 우위가 유지되는가.

    표본 하나하나가 비싼 실제 로봇 미세조정에도 쓸 수 있는가. 시뮬레이션이 아닌 실제 다지 손에서는 어떤 성능을 내는가. 홀리데이로보틱스가 이를 상용 도구로 내놓을 계획이 있는가.