래블업, AI 에이전트 인프라 비용 절감 집중
국내 기업 래블업이 AI 에이전트와 관련한 인프라 비용 절감에 주력하고 있다. 특히 GPU 자원이 제한적인 국내 상황에서 토큰 사용량을 줄이는 데 집중하고 있다.
- ·래블업, AI 인프라 비용 절감 집중.
- ·GPU 자원 제한 속 효율적 운영 강조.
- ·추론 기능 최적화로 기술 개발 방향 전환.
래블업은 AI 에이전트와 관련한 인프라 비용 절감에 주력하고 있습니다. 특히, GPU 자원이 제한적인 국내 상황에서 토큰 사용량을 줄이는 데 집중하고 있습니다. 래블업은 AI 가속기를 여러 사용자와 작업에 나눠 배치하고, 대규모 AI 워크로드를 관리하는 플랫폼 ‘백엔드닷에이아이(Backend.AI)’를 개발해왔습니다. 이 플랫폼은 모델 자체의 크기를 줄이는 대신, 만들어진 모델과 고가의 연산 자원을 실제 기업 환경에서 얼마나 효율적으로 운영하느냐에 중점을 두고 있습니다.
김준기 래블업 공동창업자 겸 최고기술책임자(CTO)는 GPU 효율화를 위해 GPU가 노는 시간을 줄이는 것이 중요하다고 강조했습니다. 시스템상 GPU가 작업에 할당돼 있더라도 데이터 전송과 컨테이너 로딩, 작업 전환 과정에서는 실제 연산이 멈추는 시간이 발생할 수 있습니다. 래블업은 이러한 비효율을 줄이기 위해 단위 시간당 가능한 한 많은 비율을 유효한 연산에 쓰도록 최적화하고 있습니다.
최근 AI 에이전트를 실제 업무에 붙이고 운영하려는 수요가 증가하면서 래블업의 기술 개발 방향도 변화하고 있습니다. 과거에는 멀티노드·멀티테넌트 학습 기능이 강점이었지만, 이제는 추론 기능의 최적화에 더 많은 연구개발 역량을 투입하고 있습니다. 특히, 대규모 환경에서는 프리필(prefill)과 디코드(decode) 작업을 서로 다른 GPU에 배치하고, 고속 네트워크로 데이터를 전달하는 방식으로 효율성을 높이고 있습니다.
관련 뉴스
관련 소식 찾는 중…