산업
VLA(비전-언어-행동) 모델이란 무엇이고 누가 만드나
VLA(비전-언어-행동) 모델은 카메라 영상과 자연어 지시를 함께 읽어 로봇의 다음 동작 명령을 내놓는 단일 신경망으로, 이미지와 글을 이해하는 비전-언어 모델에 로봇 시연 데이터를 추가 학습시켜 만든다. 구글 딥마인드와 피지컬 인텔리전스, 엔비디아, 피규어 AI, 스킬드 AI가 앞서 있고 한국은 LG와 KIST를 중심으로 추격에 나섰으며, 승부는 모델 구조보다 행동 데이터를 얼마나 싸게 모으느냐로 옮겨가고 있다.