Google DeepMind公布全新前沿AI模型Gemini 4 Argon,現階段將先透過Fairwind計畫,提供給一批受信任的網路安全防禦專家進行測試,並在逐步擴大使用範圍前,配合美國政府自願性計畫開放相關單位提前評估;Google也預告,Gemini 4 Argon後續將率先提供付費API客戶與Google AI Ultra訂閱者使用。
Gemini 4 Argon主要鎖定複雜且需要長時間執行的工作流程,強調深度推理、程式開發、企業知識工作與網路安全防禦能力,目前已有數千名內部員工使用Gemini 4 Argon處理專業程式編寫、深度研究與寫作等工作,並逐步導入實際工程環境。
輸出上限大增至100萬Token,鎖定長時間複雜任務
Gemini 4 Argon其中一項明顯升級,是將模型單次輸出詞元上限由過去的6.4萬Token,一口氣提高至100萬Token;Google認為,更大的輸出空間能讓模型在單次推演中處理更長的思考與生成流程,進一步因應過去AI較難一次完成的長時間、多階段任務。
這樣的定位也反映在Gemini 4 Argon的實際應用方向,除了日常除錯與演算法設計,Google工程團隊已開始讓模型參與大規模程式碼遷移、效能最佳化,以及跨越大量程式碼與文件的長期工作流程。
在針對真實世界長時間軟體工程任務設計的DeepSWE v1.1基準測試中,Gemini 4 Argon取得77.9%成績;在涵蓋金融、程式開發、法律與稅務工作的Vals 指數,以及多步驟金融研究 Vals Finance Agent v2、Harvey’s Legal Agent Benchmark等測試中,Gemini 4 Argon也取得領先表現。
至於Zapier用來評估企業核心業務全端執行能力的AutomationBench,Gemini 4 Argon成績為 51.3%;針對長影片理解能力的LVBench則取得91.7%,顯示 Google 不只將這款模型定位於文字與程式任務,也希望延伸至圖表、影片及多份文件整合等多模態工作流程。
已投入Google內部開發,C/C++程式碼開始大規模轉向Rust
Gemini 4 Argon目前已實際進入Google內部工程環境,其中一項大型專案,就是協助將既有C/C++程式碼庫轉移至Rust,涵蓋re2、libgav1等數萬行規模的核心函式庫,甚至延伸至程式碼超過80萬行的Fuchsia Zircon核心。
以Google開源影片解碼軟體libgav1為例,Gemini 4 Argon代理程式接手既有Rust移植版本後,進一步替換約3.2萬行SIMD程式碼,過程中會反覆進行效能測試、分析編譯器輸出,再產生能讓編譯器自動向量化的Rust程式碼。
Google指出,最後完成的版本不僅維持與原版相同的影片輸出,同時具備Rust的記憶體安全特性,執行速度更達既有Rust版本的2.7倍,效能已接近高度最佳化的C++版本;由於相關程式碼牽涉核心系統,正式導入生產環境前仍會經過自動化與人工稽核、模擬測試及程式碼審查。
Gemini 4 Argon也被用於其他工程最佳化,Google表示,研究團隊曾運用模型改善量子運算中特定程序造成的效能瓶頸,在一項實際案例中,Gemini 4 Argon花費數分鐘便找出在量子位元與邏輯閘所需時空資源方面,比現有公開文獻成果改善40%的方案。
另外,一組Gemini 4 Argon代理程式也被用於分析Google資料中心整體效能資料,自主找出並套用記憶體最佳化方式;全面部署後,已釋放超過300TiB記憶體,Google預估整體可進一步節省約500TiB至1PiB容量。
強攻網路安全,可自主尋找、驗證與修補漏洞
除了程式開發與企業工作流程,網路安全是Gemini 4 Argon此次另一項核心定位。Google將模型訓練成能自主尋找、驗證並修補軟體漏洞,並計畫向受信任的防禦專家及 Google 內部團隊提供未套用一般網路安全限制的版本,以進行更完整的防禦研究。
Wiz目前已透過「Scan for Good」計畫使用 Gemini 4 Argon,協助尋找關鍵公共基礎設施中的高風險漏洞;Google表示,在一次早期測試中,Gemini 4 Argon發現一項可能導致全球醫院所使用醫療軟體洩漏敏感個人資訊的關鍵漏洞,而這項問題先前並未被其他先進模型找出。
在評估模型漏洞修補能力的CWE-bench v1測試中,Gemini 4 Argon取得68%,並列最高分;Google內部的漏洞測試則涵蓋20種程式語言與多種複雜程式碼庫,相較先前的Gemini 3.8 Flash Cyber,Gemini 4 Argon在漏洞識別能力上進一步提升。
Wiz也透過黑箱滲透測試,評估模型在沒有原始碼的情況下分析即時網路系統的能力,結果顯示 Gemini 4 Argon在攻擊面探測、漏洞識別,以及建立用於驗證的概念驗證PoC等項目,表現均高於Gemini 3.8 Flash Cyber。
廣泛開放前先強化安全,Google同步監控模型行為
隨著Gemini 4 Argon能力提升,Google此次並未直接全面開放,而是先以分階段方式測試,包括透過Fairwind計畫讓受信任的網路安全防禦專家率先使用,同時在正式發布前開放美國政府相關單位進行評估。
Google也依據Frontier Safety Framework設計相關防護機制,目標是降低模型遭到利用進行網路攻擊,或涉及化學、生物、放射性與核能等CBRN風險,同時保留合法軍民兩用科學研究的使用空間,相關防禦措施目前已透過內部與外部紅隊,以人工及自動化方式進行壓力測試。
針對間接提示注入攻擊,Google表示Gemini 4 Argon是目前旗下防禦能力最強的模型之一,透過自動化紅隊測試及對抗式訓練,在Gray Swan間接提示注入IPI基準測試中取得領先表現。
Google同時部署機制監控Gemini 4 Argon在執行任務期間的推理與行動,一旦模型偏離使用者原始意圖或出現異常行為,可直接中止任務;訓練期間也有類似監控系統,必要時會向專門的事件應變團隊發出警報。
在執行高風險訓練或評估前,Google也會進一步隔離並封鎖沙盒環境,降低AI代理程式在測試過程中對外部系統造成影響的風險。
每百萬輸入Token 2美元,將先開放API客戶與Google AI Ultra
Gemini 4 Argon正式擴大推出後,API 價格將設定為每100萬輸入Token 2美元、每100萬輸出Token 10美元,快取輸入Token價格則比一般輸入Token低95%。
不過現階段Gemini 4 Argon仍處於逐步開放階段,Google會先持續收集首批網路安全專家與受信任測試者的實際使用回饋,再進一步調整模型與安全防護措施;後續Gemini 4 Argon將率先開放給付費API客戶與Google AI Ultra訂閱者,之後才會逐步擴大至更多開發者、企業與一般消費者。
(本文由 Newspie新聞派授權轉載,原文在此)