來源于:谷歌Meta被錘刷榜!Gemini暴跌70分,Top 2秒變倒數第三-pg平臺下載官網
發布時間:2026-09-13 07:04:40
文章摘要:
谷歌Meta被錘刷榜!Gemini暴跌70分,Top 2秒變倒數第三-pg平臺下載官網:谷歌Meta被錘刷榜!Gemini暴跌70分,Top 2秒變倒數第三-pg平臺下載官網 谷歌Meta被錘刷榜!Gemini暴跌70分,Top 2秒變倒數第三-pg平臺下載官網
新智元報道 跑分這事兒,最近有點不太對勁。被錘暴跌 9月8日,刷榜開云在線網頁版分析機構SemiAnalysis連甩五條推文,秒變直接點名谷歌和Meta兩家萬億巨頭—— Gemini 3.8 Flash和Muse Spark 1.3是倒數第「刷榜痕跡最明顯的兩個模型」。 證據,非常清晰。被錘暴跌 在測Agent干活能力的刷榜Terminal-Bench 2.1榜單上,Gemini 3.8 Flash考了89.4分,秒變在182個模型里高居第2,倒數第把GPT-6 Astra都壓在了身下。谷歌 結果換到8月29日剛上線的被錘暴跌Terminal-Bench 4.0,同一個模型只拿到19.1分,刷榜在14個測試對象里直接掉到第12,秒變成績當場打了個二折。倒數第 同一時間,GPT-6 Astra從88.4掉到57.7,好歹算個六五折。開云在線網頁版 僅僅27分鐘后,Meta首席AI官Alexandr Wang親自殺到評論區,開口直接甩出六個字,這是個愚蠢的論點。 他認為GPT-5.6 Sol在2.1上是88.8,在4.0上掉到了37.3,落差更大但沒人說Sol在刷榜。 同時他還強調,Meta從沒說過Muse Spark 1.3能跟Astra或Fable 5.1一樣強,只是它的性價比顯然更高。 換張卷子,成績直接腳踝斬 簡單介紹一下,Terminal-Bench測的是Agent真實干活的能力。 方法是丟給模型一個終端和一個模糊目標,剩下的全讓它自己看著辦。然后,系統得自行規劃路徑、調工具、寫腳本,報錯了還得自己去改。 在已經被業界刷了大半年的2.1版本上,這倆的成績確實好看。 Gemini 3.8 Flash拿下89.4分排在第2,Muse Spark 1.3以88.8分排在第4,緊隨其后的是88.4分的GPT-6 Astra和85.02分的Claude Fable 5.1。 好家伙,一個Flash級的便宜模型,一個主打性價比的Meta新作,雙雙把兩家頂級實驗室的旗艦按在地上摩擦。 然后,4.0版本來了。 新卷子一共66道題,不僅砍掉了8道已經被「刷穿」的舊題,大修了19道,還統統加上8小時的超時限制。 防作弊機制同樣上了極高強度。 主辦方不僅設了35條評分細則,還加了一輪專門的「對抗性作弊試驗」,故意讓Agent自己去試著鉆獎勵機制的空子,只要鉆得通的題就會被直接斃掉。 新榜一出,畫風突變。 Claude Mythos 5.1(max)拿到60.9分穩住陣腳,GPT-6 Astra和Claude Fable 5.1分別以57.7分和55.8分緊隨其后,再往下是52.3分的Claude Opus 5。上一代的GPT-5.6 Sol和Terra分別拿到37.3分和23.6分。 相比之下,Gemini 3.8 Flash直接暴跌到19.1分。而按SemiAnalysis給出的圖表,Muse Spark 1.3的成績是33.3分。 總結一下就是。 舊榜上,Gemini 3.8 Flash還能壓著GPT-6 Astra打;新榜上,它的分連人家的三分之一都不到,甚至被上一代的GPT-5.6 Terra甩在了后面。 不用抄答案,買套「密卷」就行 吵架歸吵架,SemiAnalysis第二條推的點名才是真正的行業內幕。 在他們看來,Terminal Bench 2.1的任務是完全公開的,Meta和谷歌絕對不會傻到直接拿原題去訓練,但他們絕對會去買數據,專門買那些被設計得無限貼近TB 2.1題型的訓練數據。最后的效果其實跟作弊沒差。 而這,就是2026年刷榜的高階玩法。 以前的「污染」套路很糙,直接把原題混進預訓練語料讓模型死記硬背。 這種事一查一個準,洗一遍數據成績就得現原形。 業界在這上面栽過不少跟頭,比如HumanEval近四成樣本被污染,GSM8K去污染后掉13分。最狠的是SWE-bench,換套私有代碼庫重測,分數直接腰斬。 所以現在大廠不碰原題了,大家改買「長得像考題的模擬卷」。也就是提供給模型試錯并給獎勵的封閉任務系統。 目前,這已經是一門明碼標價的成熟生意。![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
單個訓練任務售價200到2000美元,復雜的軟件工程任務甚至能開到2萬。
要是想克隆一個網站做成UI訓練場,大約需要2萬美元。
如果要求復刻一個Slack量級的產品,那就是30萬美元起步。
遇到要求獨家買斷的客戶,價格還能再翻4到5倍。
根據Epoch AI的調研,Anthropic內部討論過每年在這上面砸10億美元。單季合同動輒六七位數,有研究員透露均價在30萬到50萬美元一季。
供給側至少有35家公司在做這門生意,絕大多數是20人以下的初創團隊。老牌數據巨頭也全在轉型,Scale AI在被Meta入股前營收就超14億,Surge的ARR也逼近10億。
現在的局面非常魔幻。
一邊是完全公開的榜單題庫,另一邊則是成熟的賣題產業鏈。想讓模型在某個榜單上考高分,真不用費勁作弊,直接掏錢下單就行。
既當賣題機構,又當監考老師
隨后,SemiAnalysis直接點名了一家叫Datacurve的公司。
在專測長周期編程的DeepSWE 1.1榜單上,Muse Spark 1.3(max)以75.4分拿下第一,GPT-6 Astra和Claude Opus 5緊隨其后,Gemini 3.8 Flash拿到73.8分排在第四。
被指控刷榜的兩位,一個第一,一個第四。
想必,你已經發現了這背后的貓膩。
這個榜是Datacurve辦的,而Datacurve賺錢的門路,恰好是向前沿實驗室出售「專家級編碼數據和強化學習環境」。
DeepSWE不僅是Datacurve自家的基準,跑分用的還是它自己運營的評測環境。
既當賣題的輔導機構,又當出卷的監考老師,可以說是徹底坐實了。
![]()
榜單的保質期,所剩無幾
最后,SemiAnalysis順勢給整個行業的公開評測下了一道判詞。
他們覺得這說到底就是所有優質公開基準的宿命。TB 4.0也不例外,它現在看著還準,僅僅是因為它才發布了兩周。
只要它的題目還是公開的,用不了多久就會被所有標榜「前沿」的實驗室盤出包漿。
![]()
SemiAnalysis最終給出的解藥非常直接,那就是多做高質量的私有基準。
方向是對的,但代價同樣慘痛。
一旦評測全部私有化,公開榜單就會徹底淪為各家的營銷通稿。
真正有區分度的真實成績,只會在實驗室和私有評測機構之間暗箱流動。
大廠當然樂見其成,畢竟閉卷考試誰也沒法提前背題。
但對于廣大開發者來說,那把用來公平丈量所有模型的公共尺子,恐怕再也找不回來了。
參考資料:
https://x.com/SemiAnalysis_/status/2097112791471522292
編輯:摩西
返回首頁