人工智能公司Poe日前與SurgeAI合作,從推理、寫作、創造力和非英語語言能力4個維度對主流大模型包括GPT-4、Google PaLM、Claude 2、Llama 2 70b等進行了系統評估。結果顯示,GPT-4在各個維度上的表現均最突出,尤其在英語語言任務上明顯領先其他模型。Google的語言模型PaLM在非英語語言處理能力方面表現強勁,支持最廣泛的語言。此外,Claude 2的推理能力僅次於GPT-4,Llama 2 70b的寫作和創造力位居第三。Poe表示,此次評估採用了行業基準測試、專家評估、Elo評分等多種考量模型優劣的方式。各模型的具體得分和強項已公開發布,以便更深入地理解當前大模型的能力格局。業內人士認爲,各大模型均有獨特優勢,開發者應當根據具體需求進行選擇。