6月24日廣東高考放榜,一場面向AI大模型的“高考全科”測評同步出爐。據羊城晚報教育發展研究院測評,8款國内外主流大模型同場答題,訊飛星火-X2物理類總分708分,與Claude-Opus-4.8并列第一,曆史類總分則是唯一突破700分的模型。根據廣東省公布的2026高考成績,訊飛星火文理成績均進入屏蔽生行列(全省前十名)。
測評嚴格對标高考标準
參與測評的8款模型包括千問-3.7-Max、訊飛星火-X2、豆包-2.1-Turbo、DeepSeek-V4-Pro、GLM-5.2、ChatGPT-5.5-Pro、Claude-Opus-4.8、Gemini-3.5-flash。測試覆蓋語文、數學、英語及廣東新高考“3+1+2”模式下的選考科目。所有模型使用網頁端最優版本、相同提示詞、一次性生成答案,不追加提問、不人工修改,作文、解答等主觀題由兩名資深教師獨立盲評,嚴格對标高考官方評分細則。
全科穩定性成制勝關鍵
測評指出,頭部模型差距正在收窄,最終排名更多由全科穩定性決定。訊飛星火-X2的優勢并非來自某一科“極端拉分”,而是在語文、數學、英語、物理、化學、生物以及曆史、政治、地理等不同任務中保持相對均衡。在數學、物理等理科科目中,壓軸題和多步驟推導題成為區分模型能力的關鍵,部分模型容易出現步驟跳躍、邏輯斷裂甚至超綱解法,而星火在關鍵推導、過程規範和推理清晰度上表現更穩定。
教育場景深耕構築壁壘
星火大模型高考全科高分,與科大訊飛長期深耕教育場景密切相關。高考不是普通知識問答,背後是一整套教學目标、命題邏輯、評分标準和學生作答規律。科大訊飛在教育領域持續深耕二十餘年,AI技術已深度應用于全國6萬餘所學校,在真實課堂教學場景中完成億萬次與師生交互,積累了大量真實學情數據和教學反饋。
從智慧課堂到AI黑闆、智能批閱機,訊飛形成了覆蓋“教、學、考、評、管、研”的軟硬一體化教育生态。這些場景沉澱讓星火大模型更理解“老師為什麼給分、學生為什麼出錯、标準答案如何形成”。
專家:AI解題能力高速進化
有專家表示,AI解題能力正高速進化,約一年後或能在普通高考數學卷中取得滿分。同時專家也指出,AI的高分是算法基于海量數據完成的概率最優推理,不具備人類考生的情感與人格成長。技術的核心應是服務于人的全面成長,而非進行簡單的人機競技。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

