相關推薦
AI訓練數據需求激增,Micro1年營收8個月從1億美元增至5億美元
AI訓練數據需求推動標註初創企業快速增長。成立四年的Micro1過去8個月年化營收從1億美元增至5億美元,淨收入約1.5至2億美元。其規模仍低於Mercor和Handshake(年化總收入分別爲20億和10億美元),但增長顯示AI訓練數據市場正形成足夠規模。
蘋果公司計劃通過設備數據提升人工智能技術
蘋果公司(Apple Inc.)最近宣佈,將開始分析用戶設備上的數據,以增強其人工智能平臺。這一舉措旨在在保障用戶信息安全的同時,幫助蘋果在與競爭對手的人工智能技術較量中縮小差距。 目前,蘋果主要使用合成數據來訓練其人工智能模型。這種合成數據旨在模擬真實世界的輸入,但不包含任何個人信息。然而,這種合成數據並不總能準確反映實際用戶的數據,這使得蘋果的人工智能系統在運作時面臨挑戰。 爲了改善這一現狀,蘋果決定直接從用戶的設備中獲取數據。通過分析實際
谷歌研究揭示:合成數據提升大模型邏輯推理能力八倍
在最新的研究中,谷歌與卡內基梅隆大學及 MultiOn 團隊聯手,探討了合成數據對大型模型的訓練效果。他們發現,合成數據能夠顯著提升大模型在邏輯推理方面的表現,尤其是在數學問題的解決能力上,提升幅度達到了驚人的八倍。這一發現對於當前訓練數據日益匱乏的現狀具有重要的意義。目前,全球可用的高質量文本訓練數據約爲300萬億條,但隨着像 ChatGPT 這樣的模型日益普及,對訓練數據的需求急劇增加,預計到2026年,這些數據將難以滿足需求。在此背景下,合成數據成爲了一種極
谷歌新研究:合成數據助力大模型,數學推理能力提升八倍
近期,谷歌、卡內基梅隆大學與 MultiOn 的研究團隊聯合發佈了一項關於合成數據在大模型訓練中應用的新研究。根據 AI 發展科研機構 Epoch AI 的報告,目前人類公開的高質量文本訓練數據大約有300萬億 tokens,但隨着大型模型如 ChatGPT 的快速發展,對訓練數據的需求正以指數級增長,預計在2026年前這些數據將被消耗殆盡,因此合成數據逐漸成爲重要的替代方案。研究人員探索了合成數據的兩種主要類型:正面數據和負面數據。正面數據是指來自高性能大模型(如 GPT-4和 Gemini1.5Pro)生成的正確
杭州六小龍開源新模型SpatialLM,助力機器人瞬間理解 3D 世界!
最近,杭州的科技公司羣核科技再次引起了行業關注,因其開源的空間理解模型 SpatialLM 被谷歌在一篇論文中點名感謝。這個模型的創新之處在於,它能讓機器人通過一段普通的視頻理解物理世界的幾何關係,標誌着機器人訓練領域的一次重大突破。SpatialLM 的核心功能是將手機拍攝的視頻轉化爲三維空間佈局信息。用戶只需用手機錄製家中的佈局,SpatialLM 便能生成一個詳細的3D 場景,包括房間的結構、傢俱的位置和通道的寬度。這一過程大大降低了機器人訓練的成本,提高了訓練的效率。
VIP會員