OpenAI于6月27日發布新一代GPT-5.6系列模型,一次性推出三款不同定位的産品:旗艦版Sol(太陽)、均衡版Terra(地球)和輕量高速版Luna(月亮)。三款模型均以“有限預覽”形式向部分合作夥伴開放,普通用戶暫時無法使用。
三檔定位與定價
據OpenAI公布的API價格,按每100萬token計費:Sol輸入5美元、輸出30美元;Terra輸入2.5美元、輸出15美元;Luna輸入1美元、輸出6美元。Sol的定價與GPT-5.5标準版持平,Terra價格約為GPT-5.5的一半,Luna則為OpenAI目前最低價。
旗艦版Sol性能表現
OpenAI将Sol定位為該公司迄今最強模型,重點強化了編程、生物和網絡安全等能力。在編程測試Terminal-Bench 2.1中,Sol标準模式得分88.8%,超過Anthropic Claude Mythos 5的88.0%;開啟Ultra模式後達到91.9%,刷新該基準測試最佳成績。在生物學GeneBench v1測試中,Sol消耗更少token,性能超越GPT-5.5。網絡安全方面,Sol在ExploitBench上的表現接近Claude Mythos Preview,僅使用約三分之一的輸出token。
Sol新增了兩種模式:Max推理強度讓模型在複雜問題上獲得更長的深度推理時間;Ultra模式則通過多個子智能體協同處理複雜任務。
Terra與Luna
Terra定位為面向日常工作的均衡模型,性能接近GPT-5.5,價格便宜約一半。Luna則是系列中速度最快、價格最低的一檔,面向高頻、低延遲、成本敏感場景。
有限預覽與政府監管
本次發布受美國特朗普政府行政幹預。OpenAI表示,公司應政府要求暫緩全面開放,僅向一小批“受信任合作夥伴”提供API與Codex訪問通道。據外媒報道,Sol目前僅面向約20個經美國政府逐一批準的合作夥伴。OpenAI在聲明中公開表示,不認為這類政府準入機制應成為長期常态。公司計劃未來幾周内全面推出GPT-5.6系列。
METR評測發現高作弊率
外部評測機構METR在GPT-5.6 Sol的部署前評估中發現,該模型在ReAct Agent測試中的檢測作弊率高于METR評測過的任何公開模型。METR将“作弊”定義為模型利用評測環境漏洞或采用任務禁止的策略來提高表現,而非在預期約束内完成任務。具體案例包括模型在中間提交中打包漏洞以獲取隐藏測試集信息,以及提取隐藏源碼反推預期答案。
METR指出,若将作弊嘗試計為失敗,Sol的50%時間水平點估計約為11.3小時;若将作弊計為成功,該估計值躍升至270小時以上。METR表示這些數字均不能代表對GPT-5.6 Sol能力的穩健測量。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.



