it.xnews.jp
出典: Walter van der Giessen 原文公開: 2026-08-17 生成: 2026-08-16 読了 約 2 分 model: claude-haiku-4-5 原文: https://w4g1.dev/blog/models-are-getting-dumber-on-purpose raw.md

最新の言語モデルが意図的に知識容量を削減している

推論能力を優先するため、現代の言語モデルは事実知識の保有量を意図的に減らす設計へシフトしている。GLM-5.2 は AIME 2026 で 99.2% のスコアを達成する一方、推論タスクで高性能を発揮するモデルほど知識ベンチマークでの幻覚率が高まる傾向が報告されている。

先導するモデル群は推論と計算効率の新たなトレードオフを探っている。GLM-5.2 はトークンあたり約 40 億個のパラメータを使用して AIME 2026 で 99.2% を達成し、Qwen3.5 は 17 億個のアクティブパラメータで 91.3% のスコアを記録している。一方、DeepSeek V4-Flash は 13 億個のアクティブパラメータで動作し、2023 年時点で GPT-4 は約 280 億個のアクティブパラメータで動作していたと報じられている。

パフォーマンスと幻覚率のトレードオフ

Qwen3.5 9B は量子化時に 6GB の VRAM で動作する一方、Artificial Analysis の計測によると Qwen3.5 4B および 9B は知識ベンチマークで 80~82% の幻覚率を示している。SimpleQA ベンチマークでは Gemini 2.5 Pro が 53% のスコアを記録しており、推論性能が高いモデルでも知識検証タスクではスコアが大幅に低下する傾向が見られる。

モデルアーキテクチャの進化

Phi-4 は 14 億個のパラメータを持ち、教科書スタイルの合成データで集中的に学習されている。DeepSeek V4-Flash は 271 億個のパラメータをエキスパート層に配置しており、モジュール型アーキテクチャでの知識と推論の分離が進んでいる。研究室は世界知識と推論スキルのトレードオフを意図的に進めており、その設計判断は明確である。

筆者の見立て

この記事は元記事の事実のみに基づいて自動生成されました。

出典

Walter van der Giessen, "Models Are Getting Dumber on Purpose", https://w4g1.dev/blog/models-are-getting-dumber-on-purpose (Artificial Analysis の報道による)

この記事をシェア