高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

2025-06-19 16:15:14 來源:北晚在線
        【每日科技網】

  AI挑戰全套高考數學題來了!

  高考數學一結束,我們連夜使用六款大模型産品,按照一般用戶截圖提問的方式,挑戰了 14 道最新高考客觀題,不過有網友質疑測評過程不夠嚴謹,所以這次我們加上解答題,重新測一遍。

  本次參加挑戰的選手分别是:Doubao-1.5-thinking-vision-pro、DeepSeek R1、Qwen3-235b、hunyuan-t1-latest、文心 X1 Turbo、o3.并且新增網友們非常期待的 Gemini 2.5 pro。上一次我們使用網頁端測試,這次除 o3 外,其他模型全部調用 API。

  在考題選擇上,我們仍然采用 2025 年數學新課标 Ⅰ 卷,包含 14 道客觀題,總計 73 分;5 道解答題,總計 77 分。其中第 6 題由于涉及到圖片,我們就單獨摘出來,後面通過上傳題目截圖的形式針對多模态大模型進行評測。其他文本題目全部轉成 latex 格式,分别投喂給大模型,還是老規矩,不做 System Prompt 引導,不開啟聯網搜索,直接輸出結果。

  (注:第 17 題雖然也涉及到圖片,但文字表述足夠清晰,不影響答題,因此也以 latex 格式測評。)

  客觀題計分方法按照以往高考判分原則:

  單選題每道 5 分,選項正确計分,錯誤不得分;

  多選題每道 6 分,全對計 6 分,漏選按正确答案數量計分,如答案為 ABCD,漏選其一扣 1.5 分,錯選不得分;

  填空題每道 5 分,填空正确計分,錯誤不得分。

  至于解答題,由于現在還未出具體的評分細則,所以我們請數學專業的朋友進行評判,主要還是看大模型的最終答案以及解題步驟中是否有嚴重失誤點。

  7 家大模型考試成績如下圖所示。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  從客觀題來看,各家大模型幾乎拉不開差距,最大分差也隻有 3 分,第 6 題圖像題更是讓這幾家多模态大模型「全軍覆沒」。在上一次測評中,o3 客觀題成績墊底,但有網友表示,這可能是由于某些原因導緻後台自動切換成其他模型,而這一次我們選用的是未「降智」的 o3.選擇題和填空題成績仍是排在最後,當然,65 分的成績相比「降智」版确實有很大提升。

  解答題是大模型失分的「重災區」。除了 Gemini 2.5 Pro 拿到全部的分數外,其它模型或多或少均有失分。其中 DeepSeek R1 和 Doubao 最可惜,隻丢了一分;o3 則失了 2 分,最終得到 75 分。相較而言,hunyuan-t1-latest 和文心 X1 Turbo 發揮不佳,分别拿到 68 分和 66 分。

  從總分上來看,Gemini 2.5 Pro 考了 145 分,位列第一,Doubao 和 DeepSeek R1 以 144 分緊随其後,并列第二;o3 和 Qwen3 也僅有一分之差,分别排在第三和第四。受解答題的「拖累」,hunyuan-t1-latest 和文心 X1 Turbo 的總成績排到了最後兩名。

  解答題:大模型失分「重災區」

  我們先來看看解答題的情況。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  第 15 題和第 17 題,一道考查概率問題,一道涉及立體幾何知識,7 家大模型均拿到滿分。

  第 16 題是一道數列綜合題,滿分 15 分,隻要證明完整、計算過程完整、結果正确就能拿到全部的分數。大模型整體表現不錯,隻有 Qwen3 解答正确,但最終答案裡面增加了多餘的假設求值,扣了一分。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  第 18 題這道橢圓方程與幾何就難倒了不少大模型,僅 Doubao、DeepSeek R1 和 Gemini2.5 Pro 拿到滿分 17 分,其他模型各有各的扣分點。Qwen3 前面回答得都不錯,過程也很完整,但偏偏最後一小問|PQ|最大值取約等于 9 的步驟多餘,導緻結果偏差,扣了一分。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  o3 則是第(3)問答案沒化簡丢了一分。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  文心 X1 在第 2 問 (2) 正确算出 P 點軌迹,但未證明極值,直接按最遠點計算造成結果錯誤,扣 6 分。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  hunyuan-t1-latest 前兩問中回答正确,到了第 3 問完成 P 點軌迹之後就全錯了,一下子丢了 5 分。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  對于最後一道壓軸題,Gemini2.5 pro 是唯一全對的大模型。Doubao 隻說明了震蕩項的振幅大于 0.但是也有可能震蕩項的相位是反的,那樣的話最大值反而有可能更小,證明過程不夠嚴謹,扣一分。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  DeepSeek R1 在第(3)問中分情況讨論,得出了兩類解,但對第一類解未做後續說明,扣了一分。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  o3 第(2)問思路正确,但因為開閉區間差别,「完全重合」說法錯誤,扣 1 分。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  hunyuan-t1-latest 在第(2)問上思路可行但證明過程模糊,扣 2 分,到了第(3)問沒有判斷 phi 取值,又扣了 2 分。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  文心 X1 和 Qwen3 也都是在第 2 問和第 3 問上失了分,第 2 問證明模糊扣 2 分,第 3 問則是未具體說明 phi 值扣 2 分,而且文心 X1 比大小還發生錯誤,又扣了 1 分。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  客觀題:一道圖像題難倒幾家多模态大模型

  在不考慮識圖題(第6題)的情況下,客觀題大模型總體表現都不錯,Doubao、Qwen3、Gemini 2.5 pro、DeepSeek R1 、文心 X1 Turbo 和 hunyuan-t1-latest 均取得了 68 分的高分,隻有 o3 在多選題上少選了一項丢了分。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  其中,o3 在第 9 題計算過程中,忽視了「正三棱柱」這一關鍵條件。它在建立坐标系時,分别用 (x₀, y₀, 0) 表示 A 點坐标,用 (c, 0. 0) 表示 C 點坐标,但沒有考慮到:正三棱柱的底面是正三角形,這意味着正三角形的邊長 c 與 x₀、y₀之間存在關系:c=2x₀=2y₀/√3.導緻對 B 選項的判斷出現錯誤。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  接下來看看這道圖片題。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  遺憾的是,此次測評的多模态大模型都在這道識圖題上表現不佳。雖然 hunyuan-t1-latest 不是多模态,但我們又測試了 hunyuan-t1-vision ,也在這道題上敗下陣來。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  相比之下,Doubao 和 o3 至少正确識别了坐标位置,隻是誤判了視風風速方向,而 Gemini 連基本坐标都未能正确識别。

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

高考數學全卷重賽!一道題難倒所有大模型,新選手Gemini奪冠,豆包DeepSeek并列第二

  總的來說,這次測評結果顯示,大模型在數學推理能力上有不小的進步,但仍有較大的提升空間。比如不少模型在解答題上丢分,這反映出大模型在複雜推理、嚴謹論證和多步驟計算方面還需加強。

  此外,所有參測的多模态大模型在第 6 題的圖像識别上都出現了問題,這也暴露出當前 AI 在圖文結合理解方面的短闆。

  最後,緊張的高考已經結束,祝福所有考生都能取得理想的成績,有着燦爛的未來!

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

海能達發布全新專業防爆PDT對講機CH690Ex

随着我國應急管理體系持續完善,消防救援任務正在從傳統火災處置,向化工園區事故、危險品洩漏、地下空間救援、大型綜合災害等多風險、多場景方向發展。在這些複雜環境中,救援現場往往面臨爆炸性氣體、可燃性粉塵、

2周前

海能達CCW 2026載譽收官:AI與融合通信引領專用通信新未來

6月16日至18日,2026年全球關鍵通信展(CCW2026)在英國倫敦舉行。展會期間,海能達集中展示了從終端到系統、從感知到決策的全鍊路創新版圖,AI與融合通信産品及解決方案貫穿三天展期,持續獲得高

4周前

登陸歐洲 Intersolar!遠景AI電力系統支撐全球 AI 算力發展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,遠景科技集團發布面向AI數據中心的下一代電力基礎設施——融合風光儲一體化方案、固态變壓器(SST)、800V直流供電、儲能

4周前

海能達六度問鼎ICCAs,PDC650與西安機場方案摘得雙獎

6月17日,2026年國際關鍵通信獎(InternationalCriticalCommunicationsAwards,ICCAs)在英國倫敦舉行的全球關鍵通信展(CCW2026)期間正式揭曉。海能

4周前

海能達即将亮相2026年CCW全球關鍵通信展: 攜AI與融合通信解決方案登陸倫敦

6月16日至18日,2026年CCW全球關鍵通信展将在英國倫敦啟幕。作為全球領先的專用通信解決方案提供商,海能達将以全場景關鍵通信産品矩陣亮相F25展位,集中展示面向公共安全、應急救援、城市治理等領域

1個月前

海能達再獲第十一屆廣東專利獎:持續自主創新,構築專用通信知識産權高地

近日,廣東省市場監督管理局正式公示第十一屆廣東專利獎評選結果。海能達通信股份有限公司申報的“一種集群通信系統的組派接方法、通信系統及存儲介質”(專利号:ZL201811296617.7)榮獲廣東專利優

1個月前