AI企業Poeは先日、SurgeAIと協力し、推論、ライティング、創造性、非英語言語能力の4つの側面から、GPT-4、Google PaLM、Claude 2、Llama 2 70bなど主要な大規模言語モデルを体系的に評価しました。その結果、GPT-4はあらゆる側面で最も優れたパフォーマンスを示し、特に英語のタスクでは他のモデルを大きく引き離しました。Googleの言語モデルPaLMは、非英語言語処理能力において高い能力を示し、最も幅広い言語に対応しています。さらに、Claude 2の推論能力はGPT-4に次いで高く、Llama 2 70bはライティングと創造性において3位にランクインしました。Poeによると、今回の評価では、業界標準のベンチマークテスト、専門家による評価、Eloレーティングなど、モデルの優劣を判断するための多様な方法が採用されました。各モデルの具体的なスコアと強みは公開されており、現在の主要な大規模言語モデルの能力をより深く理解することができます。業界関係者は、各モデルが独自の強みを持っているため、開発者は具体的なニーズに合わせてモデルを選択すべきだと考えています。