30 秒看重點
- OpenAI 在 9 月 3 日發表 GPT-6 Astra,總裁 Greg Brockman 在發表會結尾直接說「歡迎來到 AGI 時代」,模型能自己操作瀏覽器、試算表與桌面軟體。
- 同一個 ARC-AGI-3 測驗,OpenAI 自家測試環境跑出 99.9%,ARC Prize 用中立環境重跑只有 62.7%。
- 微軟 AI 同一天推出 MAI-Transcribe-2,60 種語言平均字錯率 5.2%,每小時只要 0.10 美元,比 OpenAI 的 GPT-Transcribe 快 10 倍。
GPT-6 Astra 真的代表 AGI 來了嗎?
先講結論:能力真的往前跳了一大步,但「AGI 來了」比較像行銷用詞,連 OpenAI 自己的研究員都沒這樣背書。
9 月 3 日 OpenAI 發表 GPT-6 Astra,賣點不是聊天更順,是它會自己動手:開瀏覽器、填表單、更新客戶資料、做簡報,電腦操作測驗 OSWorld 2.0 拿到 72.6%。前幾天寫的 OpenAI 掃貨 Mac mini,養的就是這種模型。發表會最後 Brockman 丟下一句「Welcome to the AGI era」。
然後就被打臉了(有點快)。
根據 ARC Prize 的數字,Astra 在 ARC-AGI-3 用中立的 Standard 環境是 62.7%,OpenAI 自家的 Provider Adapter 環境則是 99.9%,差別在後者會保留模型看不見的推理狀態,等於考試中間可以留小抄。老實講 62.7% 已經很猛,同一份考卷 Claude Opus 5 拿 30.2%、GPT-5.6 Sol 只有 7.8%。但兩個數字掛同一個名字到處講,就是兩回事。
名詞小教室:AGI(Artificial General Intelligence,通用人工智慧)指的是「什麼題目都能做到人類水準」的 AI。你可以想像成一個能直接轉調到任何部門上工的正職員工,而不是只會做某一件事的工讀生。目前業界對它連統一定義都還沒有。
畫個重點吧,OpenAI 首席科學家 Jakub Pachocki 承認這一代模型的思考過程更難稽核,思維鏈監控「很脆弱」,趨勢「很不幸地」往壞的方向走。自家人講這句,比任何跑分都重要。
至於錢,API 每百萬 token 輸入 10 美元、輸出 50 美元。
微軟為什麼把語音辨識砍到每小時 0.1 美元?
因為語音轉文字已經被微軟當成「基礎水電」在賣,不是拿來賺錢的產品了。
微軟 AI 同一天推出 MAI-Transcribe-2,在 FLEURS 這個多語言基準的 60 種語言拿下第一,平均字錯率 5.2%,同時補上講者分離跟逐字時間戳。微軟還引用 Artificial Analysis 的評測,說它比 GPT-Transcribe 快 10 倍、比 ElevenLabs 的 Scribe v2 快 7 倍。
每小時音檔 0.10 美元,一小時會議錄音轉逐字稿,成本大概三塊台幣。
名詞小教室:講者分離(diarization)就是讓 AI 標出「這句是誰講的」。沒有它的逐字稿,就像一份沒有名字的會議記錄,十個人吵一小時你只拿到一大坨字,回頭根本查不出誰答應了什麼。
「所以我該換工具了嗎?」如果你現在做逐字稿是每小時付好幾十塊,那確實可以重算一次。不過微軟講「全世界最快最準最便宜」是自己評自己,球員兼裁判的成分要扣掉一點。這種效能拉高、價格往下砍的路數,跟前天寫的 Gemini 3.8 Flash 壓價是同一套劇本。
沙烏地的國家級 AI,為什麼建在中國的模型上?
因為從零訓練一個前沿模型太貴,直接拿別人開源的權重回來續訓,成本跟時間都差一個量級。
9 月 3 日沙烏地主權基金 PIF 旗下的 HUMAIN 在利雅德 LEAP 大會發表 humain-m3,4,280 億參數的混合專家模型。底子是中國 MiniMax 的 MiniMax-M3,再用超過 1 兆 token 的阿拉伯語內容續做預訓練,七項公開阿拉伯語基準的平均分是受測前沿模型裡最高的。
目前是研究預覽版,安全訓練完後計畫依 MiniMax 社群授權開源權重,時間指向下個月。一個把「主權 AI」喊很大聲的國家,地基選了中國的開源權重,這其實是今天最有訊息量的一則 雖然標題流量最少。
編輯觀點:AGI 喊得最大聲的那天,AI 也變得最便宜
這三則疊在一起看,畫面有點荒謬。上面在喊 AGI,下面在打價格戰,中間還有一個國家直接跳過訓練環節去撿現成權重。ARC Prize 跑一次那個測驗要 26,098 美元,微軟的語音辨識一小時 0.1 美元,同一天出場。
我自己的判斷是,AGI 這個詞今年會快速貶值。當「通用能力」變成一個要靠測試環境設定才撐得住的數字,市場很快就會回頭問更土的問題:這東西一小時多少錢、錯多少、誰要負責。微軟那則比 OpenAI 那則更貼近你明年會真的花到的錢。
回到台灣。第三則給了一條可抄的路線:不用從頭訓練,拿開源權重加上本地語料續訓,就能做出對自己語言最強的模型。繁體中文的處境跟阿拉伯語很像,語料量不大但夠特殊,台灣欠的不是算力也不是模型,是「有人願意把乾淨語料整理出來」這件苦工。至於企業端,與其開會討論要不要等 AGI,不如先把逐字稿的帳單砍掉九成,這個今天就能做欸。
明天值得關注
第一條線是 ARC Prize 會不會強制廠商公布「用哪種環境跑的」,這直接影響往後所有跑分的可信度。第二條是 humain-m3 下個月開源權重會不會準時,主權 AI 講得再漂亮,看的還是權重有沒有真的放出來。
常見問題 FAQ
GPT-6 Astra 跟前一代最大的差別是什麼?
GPT-6 Astra 最大的差別是能直接操作電腦介面,像瀏覽器、試算表與桌面軟體,完成填表單、更新資料、產出簡報等多步驟工作,在 OSWorld 2.0 電腦操作測驗拿到 72.6%。
為什麼同一個模型的 ARC-AGI-3 分數有兩個版本?
因為測試環境不同。ARC Prize 用中立的 Standard 環境測出 62.7%,OpenAI 用自家 Provider Adapter 環境測出 99.9%,後者會保留模型的內部推理狀態,兩個數字都已標註條件並列在排行榜上。
MAI-Transcribe-2 的每小時 0.10 美元是永久價格嗎?
不是。微軟公布這個價格適用到 2026 年 12 月 31 日,之後的定價尚未公布。這個模型目前可透過 Microsoft Foundry 與 MAI Playground 使用。
整理一下今天的重點:AGI 被喊得最大聲的這一天,真正會改變你帳單的其實是那個一小時 0.1 美元的語音模型。
希望這篇快報有讓你抓到今天的 AI 動向哩~如果覺得有幫助,歡迎分享給同樣在追 AI 趨勢的朋友。
我們明天見囉~
本快報由 Array 報報 AI 編輯部根據上方引用來源整理,每日 08:00 自動發佈。