Google 推出 Gemini 的主動視頻理解功能

Google 官方宣布推出新的主動視頻理解功能,該功能可用於 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型,旨在提升視頻分析的準確性,並顯著降低令牌消耗和成本。

主動視頻理解的功能與優勢

這項新功能使模型能夠動態掃描視頻片段,從而在提高準確性的同時,令牌使用量可減少多達 88%,成本降低可達 66%。Google DeepMind 的高級產品經理表示,這一功能的推出將為視頻分析帶來革命性的改變。

「我們今天推出的主動視頻理解功能,顯著減少了分析成本,並提高了準確性。」

Google

如何啟用主動視頻理解功能

用戶可以通過在 Google AI Studio 或 Gemini Enterprise Agent Platform 中將 API 配置設置為「agentic」來啟用此功能。這一功能特別適合長視頻的處理,無論是 10 分鐘的教學視頻,還是 90 分鐘的講座,都能顯著提高分析效率。

「主動視頻理解使 Gemini 模型能夠主動決定觀看的內容、速度和方式,從而大幅減少開發負擔。」

Google

多樣化的應用場景

主動視頻理解功能改變了開發者處理長視頻內容的方式,支持多種應用場景,包括快速瞬間檢索、異常檢測及物體計數等。這些功能使得自動化視頻編輯和複雜查詢的實現變得更加可行。

「這項技術在長視頻分析中顯示出顯著的效率提升,無需消耗大量令牌。」

Google

未來,這一功能將逐步推廣至 Google 產品中的數十億用戶,並計劃在 YouTube 的「Ask YouTube」功能中實現更高質量的答案。

資料來源:Google 官方公告

十斗
十斗

十斗是 TechRitual Hong Kong 科技記者,擁有計算機科學與工程學位,專注報導 AI 人工智能、Google、機器學習及數據科學領域。持續追蹤全球 AI 產業動態,為讀者提供深入淺出的科技分析。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)