gzipを言語モデルとして活用するシステム開発
2026年6月14日、Nathan Barryは圧縮アルゴリズムであるgzipを言語モデルとして機能させるシステム「gzipt」を開発しました。圧縮と予測の等価性を利用し、ビームサーチでテキスト生成を実現しています。
Nathan Barryが開発したgziptは、gzip圧縮を言語モデルとして活用してテキストを生成するシステムです。この取り組みは、「Language Modeling is Compression」の論文で確立された圧縮と予測の等価性に基づいています。論文の理論では、すべての予測モデルは本質的には圧縮器であり、すべての圧縮アルゴリズムは予測モデルだとされています。
圧縮アルゴリズムと予測の関係
gzipはDEFLATE圧縮アルゴリズムを使用します。DEFLATEは32 KiBのスライディングウィンドウ内の最近のテキストとのマッチを見つけることで次のバイトを圧縮します。シンボルをエンコードするのに必要なビット数は-log_2 p(pはモデルが割り当てた確率)で表されます。
gziptの実装と改善
gziptはバイト列に対するビームサーチを実行することでテキスト生成を行います。実装はPythonの標準ライブラリのみを使用し、zlibで記述されています。生成されたテキストの最後の部分バイトのみを採点コンテキストに保持する仕様となっています。
Nathan Barryは以前、シェイクスピアの作品に対してニューラルネットワークを使用しない無制限n-gramモデルを使用した言語モデリングについて執筆しています。元の論文がこのアプローチを試みた際はパフォーマンスが低かったとされていますが、ビームサーチの追加により生成品質が大幅に向上しました。
200バイト長の出力例を生成する際、このシステムはテキスト圧縮の原理を応用して一貫性のあるテキスト配列を生成することが可能です。
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Nathan Barry「Can gzip be a language model?」https://nathan.rs/posts/gzip-lm/ (Language Modeling is Compression の報道による)