一個模型既要讀懂DNA的序列密碼,又要看穿氣象場的時空演化,還要在醫學影像上圈出病竈——過去這得拆成好幾個各管一攤的專用模型。7月20日,上海科學智能研究院把這道難題的系統性答案攤開了:開放科學多模態基礎模型神珍(Monkey King Bang, MKB),用約110億參數,在一個統一模型裏同時接住DNA、RNA、蛋白質、小分子、地球系統和醫學影像六類科學數據,既做理解,也直接產出結果。
在科學智能這條賽道上,蛋白質、分子、氣象和醫學影像方向早就各自跑出了性能出色的專用模型。但它們背後的規律並不相通:序列講究前後依賴,分子強調原子之間的連接結構,氣象場盯着時空演化,醫學影像則看重局部細節。怎麼既保住這些差異、又讓一個模型學出它們之間可共享的規律,一直是科學基礎模型繞不開的命題。神珍正是衝着這個問題去的。

它的骨架選了Qwen3-VL-8B作爲共享主幹,再爲六類科學數據各開一條專門的數據處理通路。關鍵點在於,它沒有圖省事把所有數據都壓成同一種格式,而是在進入共享模型之前,分別把序列的先後關係、分子的連接結構、氣象場的空間分佈和醫學影像的局部細節都原樣保留下來。蛋白質與核酸仍按序列走,小分子仍按結構走,氣象數據保留空間分佈,醫學影像保留圖像細節,這些能力集成在同一個模型裏,用的時候按任務調用對應功能。除文本回答外,神珍還能直接生成RNA序列、機器可讀的SMILES分子表示、全球氣象場以及醫學影像分割結果。
在約110億參數的體量下,神珍在生物序列、小分子、氣象和醫學影像等任務裏都拿出了有競爭力的成績。在覆蓋DNA、RNA、蛋白質及不同生物序列關係判斷的20項任務中,神珍有9項拿下三款參評模型裏的最優結果,17項排進前二;逐項比下來,它在16項任務上的得分高於同量級的Biology-Instructions,而面對總參數約1萬億的Intern-S1-Pro,兩款模型各在10項任務上更勝一籌。這組對照說明了一件事:參數規模並不是衡量科學模型能力的唯一標尺,面向不同科學對象設計有效的建模方式,纔是更值得持續打磨的方向。
跳出生物序列,神珍在小分子、氣象和醫學影像上同樣做了驗證。小分子方面,在公開基準SMolInstruct的6項屬性理解任務中,神珍有4項取得或並列取得最優。氣象方面,離線評測裏給定一幀初始大氣場,模型每6小時滾動預報一步、持續推演到第10天,在第10天的預報中,500hPa位勢高度、2米溫度、海平面氣壓等多項指標達到或優於業務級數值預報的水平。醫學影像分割方面,在覆蓋CT、MRI、病理等九種影像模態、逾十萬個圖文樣本的評測中,神珍預測區域與人工標註重合程度的平均Dice得分達到91.20,在7種參評方法裏排第一,分9類影像看,5類排名第一、其餘4類排名第二。
神珍把四類代表性能力匯進了同一個統一模型:理解生物序列、預測小分子性質或生成SMILES、滾動生成最長10天的全球氣象場、依據文字提示完成醫學影像分割。不同任務會調用各自的處理組件,但共享同一模型主幹和聯合訓練的權重,研究者不必再在多個彼此獨立的領域模型之間來回切換。
對科學模型而言,開放權重只是第一步。能不能同時給到可運行的代碼、示例和清晰的輸入輸出說明,直接決定了模型能否被驗證和複用。這次發佈同步放出了模型權重、推理代碼、示例腳本、輸入說明和使用文檔,並補齊了氣象預報與醫學影像分割所需的配置,支持研究者本地部署或接入已有科研流程。研究者可以通過星河啓智科學智能開放平臺下載模型或調用API,與平臺匯聚的1500餘個科學模型和工具組合再創造,也能在Hugging Face下載權重、在GitHub獲取推理代碼與示例。
作爲今年3月初面世的系統級科研智能體大聖的超級大腦,神珍這個名字取自《西遊記》裏的天河定底神珍鐵。團隊希望這套開放模型以相對精煉的形態承載多樣的科學任務,也讓更多研究者參與進來檢驗、使用與共建。
