近日, OceanBase團隊提交的Data Agent方案登頂國際數據智能體基準Data Agent Benchmark(簡稱DAB),以90.62%的準確率位列第一,成爲該榜單首個準確率突破90%的參評方案。值得關注的是,這一成績由國產數據庫OceanBase基於國產大模型GLM-5.2構建,超過多項基於GPT、Claude Opus、Claude Fable等海外模型構建的Data Agent方案。本次參評方案內部代號爲 Scout,相關能力將融入 OceanBase DataPilot。

image.png

(圖說:OceanBase登頂國際Data Agent榜單,成爲首個準確率突破90%的參評方案)

DAB由UC Berkeley EPIC Data Lab與Hasura PromptQL合作推出,評測覆蓋互聯網/本地生活、金融股票、生物醫學、知識產權、企業運營、政務/公共管理、媒體/文娛等多個領域,並涉及PostgreSQL、MongoDB、SQLite、DuckDB等多種數據庫。

與傳統Text-to-SQL主要考察AI能否將自然語言轉換成SQL不同,DAB更關注AI進入真實數據環境後,能否從複雜、分散、形態各異的數據中找到正確答案。一個完整任務中,Data Agent需要理解數據、選擇數據、規劃分析路徑、完成查詢計算,並對結果進行驗證,考驗的是從“理解數據”到“拿到答案”的完整能力。

也正因此,DAB考驗的不只是底層模型,而是“模型+Agent+數據系統”的綜合能力。模型負責理解和推理,Agent負責規劃和執行,數據系統則要支撐數據發現、關聯計算和結果校驗。三者能否協同,直接影響AI能不能真正把企業數據用起來。

OceanBase此次參評方案,正是圍繞這一能力構建。系統通過DataLens構建數據畫像,識別字段和數據關係;再根據任務複雜程度規劃執行路徑,完成數據選擇、篩選、關聯和計算;得到結果後,還會通過證據追蹤和答案校驗檢查計算過程和結果,發現問題時調整方案並重新驗證,形成“數據理解—規劃執行—驗證修復”的閉環。

這也解釋了此次90.62%成績的含金量:它不是單純證明國產模型能夠完成數據查詢,而是驗證了國產數據庫與國產模型結合後,能夠共同支撐複雜的數據分析任務。在底層模型採用GLM-5.2的情況下,OceanBase方案最終超過了多項採用GPT、Claude Opus、Claude Fable等海外模型構建的Data Agent方案。

對OceanBase而言,這也是其AI能力的一次新驗證。

過去,數據庫主要負責存儲、查詢和處理數據。隨着AI Agent成爲新的數據使用者,數據庫需要解決的問題也在變化:AI不僅要拿到數據,還要理解數據、關聯數據、分析數據,並驗證結果是否可靠。AI時代的數據底座,也因此開始從“把數據交給AI”,走向“幫助AI把數據用起來”。

這正是OceanBase從數據庫向AI數據平臺演進的方向。OceanBase DataPilot是面向AI數據分析場景的產品方向。本次DAB評測以內部代號Scout的方案提交,相關技術能力後續將沉澱到DataPilot產品中,進一步承接數據理解、任務規劃、分析執行和結果驗證等能力,讓AI從“調用數據”走向“用數據完成任務”。

從數據庫到AI數據平臺,變化的不只是產品形態,更是數據庫與AI的關係:過去數據庫負責把數據存好、算好、取出來,如今還要幫助AI理解數據、組織數據並完成分析。此次登頂DAB,是OceanBase將數據庫能力進一步延伸到AI數據分析環節的一次驗證,也意味着數據庫正在從AI的數據底座,走向AI的數據工作引擎。