30 秒看重點
- Anthropic 在 7 月 24 日發布 Claude Opus 5,FrontierBench v0.1 跑出 43.3%,直接翻倍前代 Opus 4.8 的 21.1%,也超越 GPT-5.6 Sol 的 37.5%,搶回 AI 模型效能王座。
- 月之暗面(Moonshot AI)的 Kimi K3 今日(7 月 27 日 00:00 UTC)正式釋出開放權重,2.8 兆參數、1.4 TB 模型檔案,是史上最大的開放權重 AI 模型。
- 歐盟 AI 法案(EU AI Act)8 月 2 日起正式執法,違規最高罰全球營收 7%,但多數企業坦承還沒準備好。
Claude Opus 5 跑分翻倍,憑什麼搶回王座?
Anthropic 在 7 月 24 日正式發布 Claude Opus 5,這款模型在多個基準測試中拿下第一,正式從 OpenAI 手中搶回 AI 效能榜首的位置。
先講最猛的數字:FrontierBench v0.1(一個測試 AI 代理寫程式能力的基準)拿到 43.3%,前代 Opus 4.8 只有 21.1%,等於直接翻了一倍還多(這個漲幅真的有點誇張)。拿來跟對手比的話,OpenAI 的 GPT-5.6 Sol 是 37.5%,差距將近 6 個百分點。在 ARC-AGI-3(測新型推理能力的基準)上更離譜,Opus 5 拿到 30.2%,是第二名的三倍?!根據獨立評測機構 Artificial Analysis 的資料,Opus 5 在智慧指數(Intelligence Index)拿下 61 分、代理指數(Agentic Index)拿下 55.3 分,都是目前的最高分。
但真正讓開發者興奮的其實是定價。Opus 5 的價格是每百萬輸入 Token 5 美元、輸出 25 美元,跟前代 Opus 4.8 完全一樣,卻只要 Fable 5 的一半價格(Fable 5 是 10 美元 / 50 美元)。根據 CursorBench 3.2 的測試,Opus 5 的表現跟 Fable 5 只差不到 0.5%,但每個任務的成本砍半。簡單來講就是,你用一半的錢就能拿到幾乎頂級的效能 Anthropic 這招根本是在逼 OpenAI 降價吧。
「那 Opus 5 適合誰用?」如果你是開發者,在寫 AI 代理(Agent)或需要長文本處理的應用,Opus 5 有 100 萬 Token 的上下文視窗和最高 12.8 萬 Token 的輸出長度,還有低 / 中 / 高三段「effort」(努力程度)可以切換 — 簡單任務用低模式省錢,複雜任務再開到最高。對一般使用者來說,這代表你在 Claude 上的對話品質又提升了一個等級,而且不用多花錢。
名詞小教室:FrontierBench 是一個專門測試 AI 模型能不能像真人工程師一樣自己寫程式、自己除錯的基準測試。你可以想像成 AI 界的「技術面試」,不是考選擇題,而是直接丟一個真實的程式碼專案讓 AI 去改,看它能改對多少。
Kimi K3 開放權重今天釋出,2.8 兆參數怎麼玩?
月之暗面(Moonshot AI)的 Kimi K3 在今天(7 月 27 日 00:00 UTC)正式在 Hugging Face 上釋出開放權重,這是目前人類史上最大的開放權重 AI 模型。
2.8 兆(2.8 trillion)參數是什麼概念?你可以想像成一個讀完整個網路的超級大腦,但 K3 聰明的地方在於它用 MoE(Mixture-of-Experts,混合專家)架構,總共有 896 個專家模組,每次只叫其中 16 個出來幹活,所以實際運算量沒有參數量聽起來那麼誇張。根據 Tom’s Hardware 報導,模型檔案用 MXFP4 量化後大約 1.4 TB。
效能方面呢,K3 在 Frontend Code Arena 拿下 1,679 分排名第一,超越了 Anthropic 的 Fable 5(1,631 分)和 OpenAI 的 GPT-5.6 Sol(1,618 分)。對,你沒看錯,一個開放權重模型在前端程式碼的競技場上打贏了兩大閉源巨頭。模型採用 Modified MIT 授權,開發者可以自行下載、微調、自建部署。
順帶一提,K3 釋出的時間點也很妙,就在白宮指控蒸餾、Anthropic 剛發 Opus 5 的同一週,整個 AI 圈現在的節奏快到有點令人窒息啊。
不過,想自己跑 K3 的門檻不低。據多家技術媒體估計,最少需要 4 到 8 張 H100 80 GB GPU 才能勉強跑起來,社群量化版(Q4 GGUF)可能壓到 300-400 GB 左右,但還是需要相當的硬體資源。老實講,這東西對個人開發者來說就是看看就好,真正能受惠的是有 GPU 叢集的企業和研究機構。
「那這跟之前白宮指控的蒸餾爭議有什麼關係?」關係大了。月之暗面選擇開放權重,某種程度上是在回應蒸餾指控 — 你說我偷師?那我把整個模型攤開來讓全世界檢查。當然,蒸餾痕跡不一定能從權重裡直接看出來,但這至少是個姿態。
歐盟 AI 法案 8 月 2 日執法,企業準備好了嗎?
歐盟 AI 法案(EU AI Act)將在 8 月 2 日正式開始執行透明義務和高風險 AI 系統的合規要求,違規最高罰 3,500 萬歐元或全球年營收 7%,取兩者較高值。
距離執法只剩 6 天欸,但根據資安公司 Kiteworks 的報告,多數組織坦承還沒準備好。簡單來講,如果你的 AI 系統被歸類為「高風險」(像是用在招聘篩選、信用評分、醫療診斷等場景),從 8 月 2 日起就必須符合風險管理、透明度、人類監督設計等一整套規範。
不過事情有個轉折。據 Reuters 和 Latham & Watkins 律師事務所報導,歐洲議會最近投票通過要延後高風險 AI 系統的合規期限,分別推到 2027 年 12 月和 2028 年 8 月。可是這個延期要生效,還需要歐盟理事會(Council)在 8 月 2 日前達成政治協議,時間非常趕。
另一邊,美國白宮跟 OpenAI、Anthropic、Google 協商的「前沿模型自願審查框架」也預計 8 月 1 日前定案。據報導,這套審查的基準測試內容是機密的,而且 Meta 因為開放權重策略明確缺席。
對台灣企業來說,如果你有產品或服務觸及歐盟市場,現在就該盤點自家的 AI 應用是否落入「高風險」分類啦。就算延期案通過,第 50 條的透明義務(像是告知使用者他們正在跟 AI 互動)8 月 2 日還是照跑,這塊可不能拖唷。
編輯觀點:模型戰爭的真正贏家不是跑分最高的那個
把這三件事攤開來看,有一個滿反直覺的訊號:跑分王座的意義正在快速貶值。
Opus 5 拿下 FrontierBench 第一?很厲害。但 Kimi K3 這個開放權重模型已經在前端程式碼領域打贏了所有閉源模型,而且免費。兩個月前大家還在驚嘆 GPT-5.6 Sol 有多強,現在 Opus 5 就超過去了,再過兩個月搞不好又換人。這種「跑分王座旋轉門」告訴我們一件事:頂級模型之間的效能差距已經壓縮到個位數百分比,真正的競爭已經不在「誰跑分最高」,而在誰的生態系最完整、誰的價格最有競爭力、誰讓開發者最省事。
我覺得 Anthropic 這次最聰明的決定不是做出更強的模型,而是定價策略 — 跟 Opus 4.8 同價、Fable 5 半價,直接把「效能 ÷ 價格」這個比值拉到業界最高。對台灣的 AI 新創和中小企業來說,這比跑分第一實用多了。你不需要最強的模型,你需要的是「夠強又不會把你吃窮」的模型。
另一個不能忽略的暗流是監管。歐盟跟美國幾乎同時在 8 月初劃下紅線,而上週OpenAI 的 AI 越獄事件顯然加速了各國的監管動作。模型越來越強、開源門檻越來越低、但安全護欄的進度明顯跟不上 — 這才是 2026 下半年 AI 產業最大的懸念。
明天值得關注
Kimi K3 開放權重釋出後,社群的第一波獨立測試結果會陸續出來,到底能不能復現官方宣稱的效能是最大看點。另外,白宮前沿模型審查框架 8 月 1 日到期,最終版本的內容會直接影響 OpenAI、Anthropic、Google 未來發布新模型的節奏。
常見問題 FAQ
Claude Opus 5 跟 GPT-5.6 Sol 比起來誰比較強?
根據 FrontierBench v0.1 基準測試,Claude Opus 5 以 43.3% 領先 GPT-5.6 Sol 的 37.5%,在 ARC-AGI-3 推理測試中更是第二名的三倍。不過 AI 模型的強弱取決於具體任務,某些領域 GPT-5.6 Sol 仍可能有優勢。Opus 5 定價為每百萬 Token 輸入 5 美元、輸出 25 美元。
Kimi K3 開放權重模型一般人可以自己跑嗎?
Kimi K3 的 2.8 兆參數模型對硬體要求極高,最少需要 4 到 8 張 NVIDIA H100 80 GB GPU,完整模型檔案約 1.4 TB(MXFP4 量化格式)。一般個人電腦無法運行,但企業和研究機構可透過 Hugging Face 下載並自行部署。社群未來可能推出更小的量化版本,降低硬體門檻。
歐盟 AI 法案 8 月 2 日上路會影響台灣企業嗎?
如果台灣企業的 AI 產品或服務觸及歐盟市場使用者,就必須遵守歐盟 AI 法案的相關規定。8 月 2 日起生效的條款要求高風險 AI 系統必須符合風險管理、透明度和人類監督等要求,違規最高可罰 3,500 萬歐元或全球年營收 7%。不過歐洲議會已投票通過延期高風險系統的部分義務至 2027 年底,最終是否延期還待歐盟理事會確認。
整理一下今天的重點:AI 模型的效能天花板還在快速往上推,但真正影響你我的其實是價格戰跟監管框架,這兩件事在 8 月會越來越明朗。
希望這篇快報有讓你掌握今天的 AI 動向哩~如果這篇有幫到你,歡迎分享給同樣在追 AI 趨勢的朋友。
我們明天見囉~
本快報由 Array 報報 AI 編輯部根據上方引用來源整理,每日 08:00 自動發佈。