
最新の言語モデルが意図的に知識容量を削減している
推論能力を優先するため、現代の言語モデルは事実知識の保有量を意図的に減らす設計へシフトしている。GLM-5.2 は AIME 2026 で 99.2% のスコアを達成する一方、推論タスクで高性能を発揮するモデルほど知識ベンチマークでの幻覚率が高まる傾向が報告されている。
先導するモデル群は推論と計算効率の新たなトレードオフを探っている。GLM-5.2 はトークンあたり約 40 億個のパラメータを使用して AIME 2026 で 99.2% を達成し、Qwen3.5 は 17 億個のアクティブパラメータで 91.3% のスコアを記録している。一方、DeepSeek V4-Flash は 13 億個のアクティブパラメータで動作し、2023 年時点で GPT-4 は約 280 億個のアクティブパラメータで動作していたと報じられている。
パフォーマンスと幻覚率のトレードオフ
Qwen3.5 9B は量子化時に 6GB の VRAM で動作する一方、Artificial Analysis の計測によると Qwen3.5 4B および 9B は知識ベンチマークで 80~82% の幻覚率を示している。SimpleQA ベンチマークでは Gemini 2.5 Pro が 53% のスコアを記録しており、推論性能が高いモデルでも知識検証タスクではスコアが大幅に低下する傾向が見られる。
モデルアーキテクチャの進化
Phi-4 は 14 億個のパラメータを持ち、教科書スタイルの合成データで集中的に学習されている。DeepSeek V4-Flash は 271 億個のパラメータをエキスパート層に配置しており、モジュール型アーキテクチャでの知識と推論の分離が進んでいる。研究室は世界知識と推論スキルのトレードオフを意図的に進めており、その設計判断は明確である。
筆者の見立て
- 現在のトレンドを数年先に投影すると、フロンティアレベルの推論品質を持つモデルがコンシューマー向け GPU 1 台で動作するようになると予想している。
- 知識をウェイトから外し、総パラメータサイズをアクティブサイズに向けて削減することで、20~40B のモデルを 4 ビット量子化で 24GB のコンシューマー GPU カードに収められる可能性があると解釈している。
- このアプローチが幻覚をおおむね解決するのは、事実がウェイトの外に移動することで検証可能で修正可能になるためだと論じている。
- モデルカードに知識カットオフが記載されなくなる未来の可能性を示唆しており、ウェイトに残る知識が週単位ではなく年単位で陳腐化するようになると予想している。
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Walter van der Giessen, "Models Are Getting Dumber on Purpose", https://w4g1.dev/blog/models-are-getting-dumber-on-purpose (Artificial Analysis の報道による)