本文へ移動
10/7(水) 12:09
あとで読む
AIモデルランキングへ戻る

評価のソース

それぞれの評価が何を測り、どう更新され、順位に使われるかを、ここで確かめられます。

20今回、順位に使った評価69確かめたソースと専門の評価
順位の付け方

総合評価と使い心地

17

能力をまたぐ総合テストと、人によるブラインド投票です。

コーディング

13

コードを書くことからリポジトリを直すことまで、モデルがソフトウェアを作り上げられるかを見ます。

推論

11

数学、論理、見知らぬルールを通じて、モデルが新しい問題を考え抜けるかを見ます。

知識

5

事実についての質問と、大学院レベルの科学知識で、知識の習得と回答の正確さを見ます。

専門業務

19

金融分析、法律相談、銀行業務で、専門的なタスクをやり遂げられるかを見ます。

視覚理解

2

画像を理解する証拠は、引き続き総合ランキングに残します。画像を読み取ることとデザインの美しさは、別の能力です。

日本語と多言語

2

言語の基礎を補う証拠です。英語の文章の出来を、日本語の力とはみなしません。

「観察中」は、データ、実行の条件、使ってよい範囲を確かめている段階で、総合とカテゴリの順位には使いません。同じ評価を重ねて取得したり、表示を切り分けたりしても、票は増えません。評価どうしの問題集の重なりは、これからも確かめます。