
nanoGPT オプティマイザー スピードラン結果:18モデル153試行のベンチマーク
Prime Intellect は nanoGPT オプティマイザー スピードランで 18 の最先端言語モデル対して 153 の自動試行を実施し、各モデルのハーネス、Fable、モデル固有のオプティマイザーなどの性能指標を公開した。
ベンチマーク概要
Prime Intellect は nanoGPT オプティマイザー スピードランを実施し、153 の自動試行を通じて 18 個の最先端モデルの性能を測定した。結果は各モデルのハーネス、トレース、Fable およびその他の性能指標を含む表形式で提供されている。
個別モデルの性能結果
測定対象のモデルには様々な性能指標が記録された。Fable 5 claude-code はハーネス結果で 2,726 、検証結果で 81.7% を達成した。一方、Kimi K2.7 kimi-code はハーネス結果で 3,240 、検証結果で 7.2% という結果を示した。
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Prime Intellect『NanoGPT Speedrun Frontier』https://www.primeintellect.ai/research/nanogpt-speedrun