30 秒看重點

  • OpenAI 在 9 月 10 日把 GPT-Live-1 放上 API,這是一個能一邊聽一邊講的全雙工語音模型,定價一分鐘 0.05 美元、以秒計費,內建 12 種聲音。
  • 日本的 Sakana AI 在 9 月 11 日發表 Fugu Max 與 Fugu Ultra v2,靠「調度一整池開源與專用模型」做事,輸出價格比同級的前沿模型便宜四到六成。
  • OpenAI 同一週在 ChatGPT Work 加上 Data Agent,可以接 Snowflake、BigQuery、Databricks 等來源,直接生出 Power BI、Tableau 上的互動儀表板。

AI 語音助理為什麼突然變便宜了?

因為 OpenAI 把「會講話」這件事拆成獨立一層來賣。 根據多家科技媒體報導,GPT-Live-1 在 9 月 10 日上架 API,一分鐘 0.05 美元、以秒計費,換算下來講滿一小時大約 3 美元。

厲害的地方在於它能同時聽跟講。過去輪流講話式的系統要等你講完才動作,所以你一停頓,它就急著接話。OpenAI 公布、多家媒體轉述的測試數字是:全雙工互動性從 GPT-Realtime-2.1 的 45.4% 拉到 80.1%,換手延遲從 1.4 秒降到 0.8 秒,工具呼叫準確率從 60% 升到 87%。語言學習平台 Speak 實測,AI 誤把學習者的思考停頓當成「講完了」而插嘴的狀況少了約八成;還有一個客戶因此刪掉 2.3 萬行接管流程的程式碼。

名詞小教室:全雙工(Full Duplex)就是「可以互相插話」。半雙工像對講機,你得講完說一聲「over」對方才能回;全雙工像你跟朋友講電話,兩邊同時出聲也不會卡住。AI 語音難的一直不是發音,是抓準什麼時候該閉嘴。

工具呼叫準確率為什麼重要?可以看我們先前寫的工具呼叫(Tool Calling),那是 AI 從「只會聊天」變成「會幫你查訂單」的關鍵一步。

Sakana AI 的 Fugu Max 憑什麼贏過單一模型?

因為它根本不是一個模型,是一座調度台。 Sakana AI 在 9 月 11 日推出 Fugu Max v1.0 與 Fugu Ultra v2.0,兩個都不是自己從頭訓練的龐然大物,而是把一整池開源與專用模型當零件,依任務派工,對外只開一個相容 OpenAI 格式的 API。

價格是這則最有感的部分:Fugu Max 每百萬輸入 token 收 2 美元、輸出 6 美元,輸出比 Sonnet 5、GPT 5.6 Terra、Kimi K3 便宜四到六成。官方說 Fugu Max 在 Terminal Bench 2.1、GPQAD、AA-LCR 等六項測試拿到最佳總分,Fugu Ultra v2 則在八項中的五項最佳或並列最佳。

「那不就是 MoE 嗎?」有點像,但層級不一樣。簡單來講,混合專家模型(MoE)是在模型內部只叫醒需要的參數,Fugu 則是在模型外面挑模型,像工頭看單子決定今天派誰上工。

畢竟跑分是廠商自己公布的,球員兼裁判的問題還是在(這種數字我一律先打七折啦)。真正該看的是那個價格,它把「不靠最貴的模型也能做事」講成了一個商品。

ChatGPT Work 的 Data Agent 能幫上班族做什麼?

它能直接連公司的資料庫,回答「這個月業績為什麼掉」,然後生出一張可以分享的互動儀表板。 OpenAI 在 9 月 10 日推出這個功能,主打的就是那幾個每間公司都在問的問題:業績為什麼變慢、錢花到哪去了、哪幾個大客戶快要不續約。

能接的來源不少,包含 Snowflake、Google BigQuery、Databricks、MongoDB、ClickHouse,也能把 Google Drive 和 SharePoint 上的檔案拉進來一起看。做完的結果可以直接長在 Power BI、Tableau、Sigma 等工具上,全程不用寫查詢語法。

說白了,這是在搶「公司裡那個每週幫大家跑報表的人」的工作內容。不過前提很硬啊:資料要先整理乾淨、權限要設對。資料本身很亂的話,AI 只會用更快的速度給你一張很漂亮但不能信的圖 QQ

編輯觀點:模型正在變成零件,產品長在外面

把這三則放在一起看,共同動作不是「又變強了」,而是都在把模型往後推。GPT-Live-1 被 OpenAI 自己定位成前端語音層,深度推理交給後面的 GPT-6 Astra 或第三方模型;Fugu Max 乾脆不押注任何一家前沿模型,把它們都當零件調度;Data Agent 則是把 ChatGPT 塞在 Snowflake 跟 Power BI 中間當介面。模型還是很重要,但它越來越不是那個被賣掉的東西了。

對台灣公司來說,這其實是一種鬆綁。老實講我覺得被低估的是 Fugu 那則:很多公司到現在還卡在「要不要整廠押注某一家模型」的會議裡,編排型的答案是你可以不用選,之後換零件就好啦。

但同一件事的反面是,多一層調度就多一層會出錯的地方。出事的時候你要查的不再只是「模型答錯了」,而是「這題當初被派給了誰」。這種帳最後通常會算到工程師頭上 所以真的要導入,先把記錄留好比先比價重要。

明天值得關注

Meta Connect 這個月登場,據報導可能發表面向 Muse 的 Shared Agents;OpenAI DevDay 也傳出要推 Managed Agents,兩邊搶的是同一批中小企業客戶。誰先把價格跟能接哪些系統講清楚,誰就先拿到單。


常見問題 FAQ

全雙工語音 AI 跟現在的語音助理差在哪?

全雙工語音 AI 可以一邊聽一邊講,不必等使用者說完才反應,因此能自然處理插話、停頓與背景雜音。OpenAI 的 GPT-Live-1 在自家測試中,全雙工互動性從前代的 45.4% 提升到 80.1%。

AI Agent 是什麼?跟聊天機器人有什麼不同?

AI Agent 是能自己拆解目標、呼叫工具、完成多步驟任務的人工智慧系統,聊天機器人則以一問一答為主。以 ChatGPT Work 的 Data Agent 為例,它會主動去連 Snowflake、BigQuery 等資料來源查出原因,再把結果做成儀表板,而不是只回你一段文字。

編排型模型會取代 ChatGPT 或 Claude 嗎?

短期內不會,因為編排型模型本身就要靠這些模型當零件。Sakana AI 的 Fugu Max 是把一池開源與專用模型組合起來運作,價值在於成本與彈性,輸出價格比 Sonnet 5、Kimi K3 等前沿模型便宜四到六成。


整理一下今天的重點:語音一分鐘 0.05 美元、編排把輸出成本砍掉四到六成、資料庫直接生儀表板,AI Agent 這一輪比的真的不是誰最聰明,是誰能讓你天天用得起。

希望這篇快報有讓你掌握今天的 AI 動向哩~如果這篇有幫到你,歡迎分享給同樣在追 AI 趨勢的朋友。

我們明天見囉~

本快報由 Array 報報 AI 編輯部根據上方引用來源整理,每日 08:00 自動發佈。