Gemini 3.5 與 Omni 模型實測:多模態 Agent 的技術 Pipeline 分析

文章摘要

Google 於 I/O 2026 發布 Gemini Omni 與 Gemini 3.5 Flash 模型。Gemini Omni 具備強大影音生成與編輯能力,支援以多模態輸入(影音圖文)進行對話式編輯,確保物理特性與角色一致性;Gemini 3.5 Flash 則專注於執行長週期、複雜的代理(Agentic)工作與編碼任務。

這些技術旨在解決用戶需手動繁瑣編輯影音,以及 AI 執行多步驟工作流時效能與邏輯不足的痛點,目標受眾涵蓋影音創作者、開發者及一般日常用戶。Gemini 3.5 Flash 結合 Antigravity 架構,能部署子代理協助自動化任務,並支援在 Google 搜尋中生成即時互動式 UI 或客製化儀表板。

其核心意義在於推動「代理式 AI」普及,透過 24 小時運行的個人代理 Gemini Spark 與搜尋引擎的資訊代理,將 AI 從輔助生成轉向主動執行任務。目前限制在於高階功能(如資訊代理、自訂體驗生成)初期僅限美區付費會員使用,且複雜工作流的執行仍需在嚴格監督下進行,以確保結果可靠。

AI 大叔解析

【新聞懶人包】
Google 最新發表了多款 Gemini 模型,包括多模態的 Gemini Omni 和強調代理人(Agentic)能力的 Gemini 3.5 Flash,並推出個人AI代理 Gemini Spark。Omni 允許使用者透過對話編輯影片,而 3.5 Flash 則藉由 Antigravity 框架,強化了處理複雜、多步驟任務的能力,並已整合到 Google Search 與 Gemini app 中,能生成客製化UI或自動化工作。Gemini Spark 作為個人AI代理,已整合至 Workspace。這些新功能已陸續開放給 Google AI 訂閱用戶,部分生成式UI功能則將免費開放給所有 Search 用戶。

【主戰場】軟體工程與生產力
【真正主訊號】Google 大力推動多模態 AI Agent 的實用化,將其能力深度整合到核心產品中,以提升使用者生產力。
證據等級:A★★★★★ (已部署)
原因:Gemini Omni、3.5 Flash 及 Spark 已陸續在全球或特定地區對訂閱用戶部署,成為 Gemini app、Search 及 Workspace 的預設或整合功能,並實際展示多種應用案例。

【以前卡哪?現在卡哪?】
以前卡在:AI 模型雖具備強大生成能力,但缺乏跨應用、多步驟執行複雜任務的能力,且多模態內容的對話式精準編輯仍是挑戰。
現在換卡到:Google 透過 Gemini 3.5 Flash 的「agentic coding capabilities」和 Antigravity 框架,以及 Omni 的多模態對話式編輯能力,讓 AI 能更好地執行「long-horizon tasks」,並提供更流暢的內容生成與修改體驗。

【真正關鍵】AI Agent 的「實用化穩定性與成本效益」
原因:新聞強調了 Agent 在「complex long-horizon tasks」上的「frontier performance」和「reliably execute multi-step workflows」。這些聽起來很厲害,但 Agent 在實際多變情境下的可靠性與準確性一直是瓶頸。另外,這些複雜任務需要大量運算資源,導致高昂的運行成本。Google 透過訂閱制(Pro & Ultra subscribers)來區隔服務,同時免費提供部分功能,就是為了在實用性與成本之間取得平衡。

【另外兩個重點】
1. Google 將 AI Agent 能力深度整合至 Search 和 Workspace 等核心生態系,企圖大幅改變使用者與數位世界的互動模式,從被動搜尋轉為主動代理執行。
2. 多模態的內容創作(特別是影片)進入對話式編輯時代,大幅降低了影片修改的專業門檻,讓一般使用者也能快速進行複雜編輯。

【重要程度】高

【毒舌吐槽】
這波 Google 推出 Omni 和 3.5 Flash,再配個什麼 Antigravity 搞 Agent,說真的,口號喊得是震天價響。什麼「從任何輸入創造任何東西」、什麼「可靠地執行多步驟工作流程」,這些台詞我都快背起來了。光看 Demo 影片當然是流暢到不行,彷彿電腦突然開了竅,變成你的超高效率小秘書。但這種「演示效果」跟「實際落地」的落差,身為老骨頭工程師,我可是看得多了。

尤其那個 Antigravity,聽起來像是搞定了 AI Agent 過去「情境理解不足」、「步驟容易卡關」的老毛病。要是沒一套嚴謹的錯誤處理、狀態管理跟回溯機制,我看再強的模型也只是跑出個「精美的錯誤訊息」而已,使用者真的會把重要工作交給它 24/7 運行?還有那個「免費」提供生成式 UI,但更厲害的 Agent 功能卻得綁定「Pro & Ultra 訂閱」。這不就是明明白白的「成本壓力轉嫁」嗎?高運算消耗的模型當然要有人買單,但用免費小甜頭來引導使用者升級,這商業模式,老實說,沒什麼新意,就是看誰的口袋深、誰能撐多久。

【為什麼重要?】
* **系統影響:** 這次發布代表 Google 正將其 AI 模型從單純的內容生成工具,轉型為更具「執行力」(agentic capabilities)和「多模態互動」(multimodal interaction)的智能代理。這種轉變會對現有的軟體系統架構和使用者介面帶來顛覆性影響。過去我們需要一個個 App 來完成任務,現在 AI Agent 可能會直接在後台串聯多個服務,例如 Gemini Spark 能整合 Gmail、Docs 和 Instacart,從單純回應變成主動「採取行動」,這是從「工具」到「協作者」的範式轉移。對於企業應用,尤其是需要處理大量非結構化數據、或複雜跨系統流程的場景,若能導入這類 Agent,未來可能會重塑現有的業務流程與 IT 架構。
* **成本或能力變化:** Gemini Omni 和 3.5 Flash 提供了前所未有的內容創作與任務自動化能力,大幅降低了影片編輯門檻,也讓「長程多步驟」的代理任務變得可行,理論上能節省大量人工操作時間。舉例來說,3.5 Flash 能在 60 秒內生成多種 UX 設計,或自動分類資產。然而,這些強大能力的背後是龐大的算力消耗與模型訓練成本。Google 透過「Pro & Ultra 訂閱制」來分攤這些「高階」Agent 的運行成本,並將部分「生成式 UI」免費開放,是為了擴大市場觸及率並培育用戶習慣。這意味著,企業或深度使用者若要真正發揮這些 AI Agent 的潛力,享受「frontier performance」和「reliably execute」的服務,勢必需要支付更高的訂閱費用。
* **苦主與爽主:** 苦主可能是傳統的影片剪輯軟體或特定自動化工具的開發商,如果 Omni 的對話式編輯體驗夠流暢且功能完整,可能會壓縮其市場空間。另一方面,需要處理大量重複性工作、跨應用資訊整合,或需要快速生成創意內容的個人與企業,將是潛在的爽主。例如,資訊工作者透過 3.5 Flash 的「information agents」能 24/7 追蹤資訊,或利用 Spark 自動執行 Workspace 任務,可能大幅提高效率。Google 本身則透過強化其核心產品的 AI 能力,鞏固了其市場領導地位,並開闢了新的訂閱收入來源,無疑是最大的爽主。

【實戰建議】
動作:企業應審慎評估現有工作流程中,哪些「重複性高」、「跨系統整合複雜」且「對時間敏感」的任務,是否能透過導入如 Gemini Spark 結合 Antigravity 這類 Agent 型方案,進行成本效益分析與小規模試點。
對象:有大量知識工作者、數據處理需求,或面臨資訊過載挑戰的大中型企業。

【一句話總結】
Google強化多模態內容創作與AI Agent執行力並深度整合至核心產品,但高階功能仍需付費,實用性與成本平衡是關鍵。

【逆風觀點】
新聞雖然強調了 Agent 的「frontier performance」和「reliably execute」,但在真實世界中,AI Agent 處理「模糊指令」、「異常情況」或「第三方系統變動」時,其「可靠性」和「泛化能力」是否真能達到宣稱的「實戰級」,還有待長期驗證。過去許多 AI Agent 的應用往往止步於概念驗證,真正規模化部署後,持續的維護成本、故障排除機制和安全性考量,才是企業導入時需要面對的更大挑戰。Demo 影片與實際運行的複雜度,往往天差地遠。