OpenAI 正式發布 GPT-6 Sol 與 GPT-6 Luna 兩款新模型,兩者均以 GPT-6 Astra 的類似方法訓練,API 價格較 GPT-5.6 促銷定價下降 50%,Sol 主攻高階自動化任務,Luna 主打低成本的日常應用,香港開發者可按工作量與預算直接替換現有模型。
新模型發布重點:一次看懂
OpenAI 在官方公告中宣布推出 GPT-6 Sol 和 GPT-6 Luna,並說明兩款模型以 GPT-6 Astra 的類似方法訓練。這代表兩款新模型共享同一套訓練路線,只是定位不同:Sol 面向需要深度推理的自動化工作,Luna 則針對大量、高頻率的日常請求。
其實對香港用家來說,最直接的影響不是能力名稱,而是帳單。這次兩款模型的 API 價格均較 GPT-5.6 促銷定價降低 50%,降幅相當明顯(OpenAI 官方公告)。
GPT-6 Sol Luna 新模型發布 價格比較
價格是這次發布的核心。坦白說,50% 的降幅在主流模型更新中並不常見,具體數字如下:
| 項目 | 前代 GPT-5.6 定價 | GPT-6 新定價 | 降幅 |
|---|---|---|---|
| Sol 輸入(每百萬 token) | 4 美元 | 2 美元 | 50% |
| Sol 輸出(每百萬 token) | 20 美元 | 10 美元 | 50% |
| Luna 輸入(每百萬 token) | 0.20 美元 | 0.10 美元 | 50% |
| Luna 輸出(每百萬 token) | 1.20 美元 | 0.50 美元 | 58% 以下成本效益另見下文 |
Sol 從輸入 4 美元降至 2 美元、輸出從 20 美元降至 10 美元;Luna 則由輸入 0.20 美元降至 0.10 美元、輸出由 1.20 美元降至 0.50 美元。說實話,Luna 的輸出價格已經低到可以放心放在高流量客服場景,不必逐句計算成本。
Sol 適合誰:自動化與代理任務
Sol 的賣點不在聊天,而在工作。OpenAI 公布的 AutomationBench 測試中,GPT-6 Sol 以 xhigh effort 的表現勝過 Claude Opus 5 的 max effort,而成本僅為後者每任務成本的 9%。換句話說,用不足一成的價錢做到更高水準的結果,這對需要跑大量自動化流程的團隊來說,是結構性的成本優勢。
另一項 Agents’ Last Exam 測試同樣值得留意:GPT-6 Sol 以 max effort 取得 56.4% 分數,高於 Claude Opus 5 的最高分,且每任務成本低 60%。偏偏很多開發者選模型時只看排行榜分數,忽略每任務成本,這次數據把兩個維度放在一起,選擇就清晰得多。
Luna 適合誰:高流量的日常應用
Luna 的定位是「用得多、用得平」。在同一輪 AutomationBench 測試中,GPT-6 Luna 在 high effort 下較其前代提升 5.4 個百分點,且每任務成本低 58%。能力上升、價格下降,兩者同時發生,對每天處理數以萬計請求的產品而言,差距會被規模放大。
其實多數香港中小企業的 AI 應用——回覆查詢、整理文件、摘要報告——根本用不著旗艦級推理,Luna 這種檔位的模型反而更符合實際需求。
AutomationBench 1.0.6 測了什麼
有人會問,這些基準測試到底量度什麼?根據 OpenAI 的說明,AutomationBench 1.0.6 要求 AI 代理在銷售、市場、營運、支援、財務及人力資源六個範疇,使用 47 個工具完成端到端工作流程。這不是簡單的問答測驗,而是模擬真實企業環境中的多步驟任務。
測試橫跨 6 個部門職能、動用 47 個工具,貼近實際營運情境,因此結果對企業採購決策的參考價值,比純學術基準更高。想了解各版本細節差異,可參考這篇 GPT-5.6 Sol vs Terra vs Luna 完整比較:功能差異 + 定價 + 官方基準圖表。
事實性與可靠性:錯誤減半
Sol 在內部事實性評估中,錯誤數量約為其前代的一半。對需要輸出財務摘要、法律文件初稿或客戶合約內容的場景,錯誤率減半意味著人工覆核的工作量相應下降,這是比分數更實在的進步。
不過要補一句:錯誤減半不等於零錯誤,重要業務輸出仍然必須經人手核實,尤其涉及監管要求的行業。
重度用家視角:OpenAI 內部數據的啟示
OpenAI 披露了一組內部編碼使用數據:以 API 價格計算,中位數研究員每日 token 使用量超過 600 美元,第 90 百分位研究員更超過 7,000 美元。這組數字說明兩件事——重度專業用家的消耗量驚人,而價格下調 50% 對這類用戶的年度開支影響,遠比一般用家想像的大。
假如你的團隊也有類似強度的使用習慣,這次換模型的投資回報其實不難計算。
香港開發者應該怎樣選:實用建議
以下是基於官方數據的選型建議(屬一般性建議,並非官方指引):
- 高頻低成本場景(客服機械人、內容摘要、表單整理)選 Luna,輸出價格 0.50 美元每百萬 token,規模效應明顯
- 多步驟代理任務(流程自動化、跨系統操作)選 Sol,AutomationBench 與 Agents’ Last Exam 的數據均指向其優勢
- 混合部署:以 Luna 處理流量、Sol 處理難題,是最常見的架構安排
明明 Luna 價格低得多,不少團隊卻習慣性把所有請求都送往旗艦模型,結果搞到成本失控。按任務難度分流,才是這次定價結構想鼓勵的用法。
常見問題
GPT-6 Sol 同 Luna 的價格比 GPT-5.6 平多少?
兩款模型 API 價格均較 GPT-5.6 促銷定價降低 50%。Sol 輸入由 4 美元降至 2 美元、輸出由 20 美元降至 10 美元;Luna 輸入由 0.20 美元降至 0.10 美元、輸出由 1.20 美元降至 0.50 美元(每百萬 token 計)。
GPT-6 Sol 與 Claude Opus 5 比較表現如何?
在 AutomationBench 測試中,GPT-6 Sol 以 xhigh effort 勝過 Claude Opus 5 的 max effort,每任務成本僅為後者的 9%;在 Agents’ Last Exam 中,Sol 以 max effort 取得 56.4%,高於對方最高分,成本低 60%。
Luna 適合什麼應用場景?
Luna 在 high effort 下較前代提升 5.4 個百分點且每任務成本低 58%,適合客服、摘要、文件整理等高流量日常應用。
AutomationBench 1.0.6 是什麼測試?
一項要求 AI 代理在銷售、市場、營運、支援、財務及人力資源範疇使用 47 個工具完成端到端工作流程的基準測試。
本文資料來源可靠嗎?
本文數據均引自 OpenAI 官方公告,內容僅供參考,不構成專業意見,採購決策前請以官方最新文件為準。