
Google은 오늘 최신 Gemini 3.7 Flash, 3.6 Flash 및 3.5 Flash-Lite 모델에 에이전틱 동영상 이해(agentic video understanding) 기능을 출시한다고 발표했다. 이 기능은 동영상 분석 정확도를 높이는 동시에 동영상 분석 과정에서 사용하는 Token과 비용을 대폭 줄일 수 있다.

이 기능은 표준 Gemini API Token 가격 정책이 적용되며, 기능 사용에 따른 추가 비용은 없다.
기존의 ‘정적’ 처리 방식에서는 모델이 고정된 프레임 속도로 동영상을 읽으며 기본값은 1 FPS이고 API를 통해 조정할 수 있다. 반면 에이전틱 동영상 이해는 모델의 핵심 추론 기능과 기본 동영상 도구를 결합해 시각 프레임, 오디오, 자막 텍스트에서 대상 동영상 구간을 동적으로 검색하고 스캔하며 확인한다.
표준 동영상 분석 벤치마크 테스트에서 에이전틱 동영상 이해를 탑재한 Gemini 모델은 분석 비용을 최대 66% 낮추고 Token 사용량을 최대 88% 줄이는 동시에 정확도를 최대 7% 향상할 수 있다. 이러한 효율성 향상은 긴 동영상에서 특히 두드러진다. 기존 정적 처리 방식에서는 개발자가 높은 Token 비용과 핵심 세부 정보 손실 사이에서 선택해야 했기 때문이다.
Google은 Gemini 3.7 Flash와 에이전틱 동영상 이해를 함께 사용하면 전반적인 품질이 가장 높고, 품질과 비용 효율성 사이에서도 최적의 균형을 달성한다고 설명했다. 동영상 이해 작업에서 정확도와 비용 간 파레토 최적 전선에 해당한다.
정적 처리에서 모델이 고정된 프레임 속도로 미디어 스트림을 읽는 것과 달리, 에이전틱 동영상 이해를 사용하면 Gemini가 어떤 내용을 볼지, 어떤 속도로 볼지, 어떤 모달리티(프레임, 오디오 또는 자막 텍스트)를 통해 정보를 얻을지 능동적이고 목적에 맞게 결정할 수 있다. 필요한 구간과 신호만 추출하는 방식이다. 이전에는 개발자가 이 작업을 수동으로 수행해야 했지만, 에이전틱 동영상 이해를 사용하면 Gemini가 지능형 루프를 통해 관련 동영상 부분을 불러오는 내부 도구를 호출할 수 있어 개발 작업량을 크게 줄일 수 있다.

IT之家의 취재에 따르면, 이 기능은 개발자가 긴 동영상 콘텐츠를 처리할 때 다양한 새로운 기능을 제공한다.
1초 미만 단위 순간 검색: 1 FPS에서는 놓치기 쉬운 순간적인 상태 변화와 빠르게 이어지는 편집 경계를 정확하게 찾아 고정밀 자동 동영상 편집을 구현한다.
긴 동영상에서 ‘바늘 찾기’ 검색: 수 시간 분량의 동영상에서 복잡한 질문에 답하면서도 수백만 Token을 소모할 필요가 없다.
이상 감지: 관심 있는 시간 구간을 더 높은 프레임 속도로 다시 샘플링해 빠른 움직임과 미세한 시각적 아티팩트를 확인한다.
동작 및 객체 수 세기: 시간의 흐름에 따라 반복되는 물리적 동작과 서로 다른 객체를 정확하게 추적한다.
현재 이 기능은 Google AI Studio와 Gemini Enterprise Agent Platform의 Gemini API에서 출시됐으며, 동영상 업로드와 YouTube 동영상 분석을 지원한다. 개발자는 API 구성에서 처리 모드를 ‘agentic’으로 설정하기만 하면 이 기능을 활성화할 수 있다.
Google은 앞으로 일반 사용자 대상 제품에도 이 기능을 확대할 계획이다. 곧 Gemini 앱의 모든 Flash 및 Flash-Lite 모델 사용자에게 이 기능이 제공될 예정이며, 향후 몇 개월 안에 에이전틱 동영상 이해가 YouTube 동영상 시청 페이지의 ‘Ask YouTube’ 기능을 지원하게 된다. 이를 통해 Gemini가 동영상 화면을 기반으로 더 높은 품질의 답변을 제공할 수 있다.
