Google推旗艦模型Gemini 4 Argon 基準測試結果勝對手 惹「刷榜」質疑
發佈時間:11:54 2026-10-01 HKT
Alphabet旗下Google推出新一款旗艦人工智能模型Gemini 4 Argon,稱它為目前最先進的AI模型,主攻複雜、長時間工作流程,包括軟件開發、網絡安全任務。不過,據彭博報道,該模型在正面臨公司內部,對其在程式碼編寫等關鍵領域表現的疑慮;並引述專家指Google或過度關注基準測試而「刷榜」(benchmaxxing)。
據報Gemini 4 Argon主打長時間軟件工程、企業知識工作與網路安全防禦等複雜任務。Google周三向一小群資訊安全合作夥伴公開該模型,並表示在經過額外測試後,將從付費用戶開始擴大開放存取權。該公司指出,Gemini 4在多項基準測試中取得領先成績,包括在衡量安全技能的測試中勝過OpenAI的Astra模型。
Google稱目前最先進AI模型
據Google 公布的測試結果,Gemini 4 Argon在 DeepSWE v1.1 長周期軟件工程測試取得 77.9%,高於 Claude Opus 5.5 的 74.2% 與 GPT-6 Astra 的 74.1%。Google稱Gemini 4 Argon為目前最先進的AI模型,但目前尚未全面開放給一般使用者。
否認Gemini 4程式碼編不佳
不過彭博引述Google內部人士指,雖然Gemini 4在廣泛用於衡量模型效能的基準測試中表現優異,但當員工實際將其投入工作時,表現卻大打折扣。知情人士表示,該模型在處理特定程式碼編寫任務時相當吃力。Google回應指,Gemini 4在程式碼編寫等領域表現不佳並不準確。有熟悉模型開發的Google員工表示亦否認模型在處理複雜、真實世界的程式碼編寫任務時面臨困難。
刷榜:專注評測中取得高分
報道引述專家表示,Google可能受業界過度關注基準測試傾向的困擾,這種現象被稱為「刷榜」(benchmaxxing),即工程師比起創造能良好完成工作的產品,更專注於取得高分。AI 實驗室往往會這麼做,因為客戶經常透過基準測試分數來評價模型。兩位熟悉該模型的人士表示,Gemini 4 似乎受到了這種做法的影響。
去年11月,Google推出Gemini 3大受好評,並被視為公司跟上OpenAI和Anthropic的轉折點。Google在5月的 I/O 大會上宣布了名為Gemini 3.5 Pro的新改版,並承諾在次月發布該模型。但知情人士透露,該公司其後已放棄了3.5 Pro。

















