신모델·기능HF Daily Papers· 2026-07-18
비디오 이해의 새로운 시대, VideoChat3
VideoChat3는 비디오 이해를 위한 완전한 오픈 소스 MLLM으로, 효율적이고 일반적인 비디오 이해를 제공합니다.
핵심 포인트
- ·VideoChat3는 효율적이고 일반적인 비디오 이해를 제공합니다.
- ·I3D-ViT와 적응형 프레임 해상도를 통해 효율성을 높입니다.
- ·4억 개의 파라미터로 높은 성능을 자랑합니다.
VideoChat3는 비디오 이해를 위한 혁신적인 오픈 소스 MLLM(다중 언어 모델)입니다. 이 모델은 두 가지 주요 설계를 통해 비디오 이해를 발전시킵니다. 첫째, 효율성을 위해 I3D-ViT(팽창 3D 비전 트랜스포머)와 적응형 프레임 해상도 기술을 도입하여 비디오 입력의 처리 비용을 줄입니다. 이로 인해 비디오 입력의 시공간 표현을 효율적으로 처리할 수 있습니다.
둘째, 효과성을 높이기 위해 확장 가능한 비디오 데이터 합성 파이프라인을 개발했습니다. 이를 통해 VideoChat3는 VideoChat3-Academic2M, VideoChat3-LV116K, VideoChat3-OL617K이라는 세 가지 다양한 고품질 학습 데이터셋을 큐레이션하여 일반, 장편, 스트리밍 비디오 시나리오를 다루며 모델의 일반화 능력을 향상시킵니다. 이러한 설계를 통합함으로써 VideoChat3는 광범위한 일반화와 계산 효율성의 균형을 이루었습니다.
실험 결과, VideoChat3는 4억 개의 파라미터로 이전의 오픈 소스 모델들을 능가하며, 더 큰 파라미터 수를 가진 모델들과도 동등하거나 더 나은 성능을 보였습니다. 이는 비디오 콘텐츠 마케팅을 강화하려는 기업들에게 중요한 도구가 될 수 있습니다.
관련 뉴스
관련 소식 찾는 중…
📰 오늘의 카드뉴스일간 매거진 · 5장