2026-07-31 브리핑 · Google DeepMind, 로봇 전체 제어 AI 모델 공개
신모델·기능HF Daily Papers· 2026-07-31

TurboVLA, RTX 4090에서 실시간 VLA 모델 실행

TurboVLA는 RTX 4090에서 1GB 미만의 VRAM으로 초당 32Hz의 실시간 비전-언어-행동 모델 실행을 가능하게 한다. 이는 LLM 기반의 경로를 채택하여 시각적 관찰을 처리한다.

핵심 포인트
  • ·TurboVLA는 V+L→A 매핑으로 VLA 모델을 재구성합니다.
  • ·RTX 4090에서 0.9GB 미만 VRAM으로 32Hz 성능을 발휘합니다.
  • ·97.7% 평균 성공률로 대형 VLA 정책을 능가합니다.

TurboVLA는 기존의 비전-언어-행동(VLA) 모델의 구조를 혁신적으로 바꾼 새로운 패러다임을 제시합니다. 전통적인 VLA 모델은 시각적 관찰을 대형 언어 모델(LLM)의 표현 공간으로 투영한 후 로봇 행동으로 해석하는 경로를 따릅니다. 그러나 이 방식은 매번 정책을 호출할 때마다 상당한 계산 및 메모리 부담을 초래합니다. TurboVLA는 이러한 경로를 시각과 언어를 직접 연결하는 V+L→A 매핑으로 재구성하여, 경량화된 양방향 비전-언어 상호작용을 통해 정보를 교환하고 간단한 디코더로 행동을 예측합니다.

TurboVLA의 간단한 설계는 시각적 및 언어적 특징에서 직접 작업 조건에 맞는 표현을 구성하여 VLA 추론의 계산 및 메모리 비용을 크게 줄입니다. 이 모델은 RTX 4090과 같은 소비자급 그래픽 카드에서 0.9GB 미만의 VRAM으로 초당 32Hz의 실시간 성능을 발휘하며, 97.7%의 평균 성공률을 기록합니다. 이는 기존의 대형 VLA 정책을 능가하거나 동등한 성능을 보여줍니다.

이러한 결과는 TurboVLA가 기존의 LLM 중심 VLA 패러다임에 대한 간단하고 효과적인 대안임을 입증하며, 비전, 언어, 행동을 효율적으로 연결하는 새로운 관점을 제공합니다. TurboVLA의 코드는 공개되어 있어, 실제 환경에서 AI 모델의 즉각적 반응을 요구하는 애플리케이션에 적합한 성능 개선을 보여줍니다.

관련 뉴스

관련 소식 찾는 중…

📰 오늘의 카드뉴스일간 매거진 · 5장