it.xnews.jp
出典: Cactus Compute 原文公開: 2026-10-02 生成: 2026-10-08 読了 約 3 分 model: claude-haiku-5-5 原文: https://cactuscompute.com/blog/whistle raw.md

Cactus Computeが16.9 MBの音声認識モデル「Whistle」を公開、CPU上で7言語を文字起こし

TL;DR: Cactus Computeは、CPU上で動作するオンデバイス音声認識モデル「Whistle」を公開した。ファイルサイズは16.9 MBで、Needleと同じC++エンジンに読み込まれる。英語、ドイツ語、フランス語、スペイン語、イタリア語、オランダ語、ポーランド語の7言語の文字起こしに対応し、モバイル機器、ウェアラブル、ロボット、スマートホーム、自動車、マイコンを対象としている。

Cactus Computeは2026-10-02、音声認識モデル「Whistle」を公開した。Whistleは同社のNeedleと同じC++エンジンでCPU上で動作し、文字起こし、単語タイムスタンプ、音声埋め込みをデバイス上で行う。

発表内容

Whistleは、モバイル機器、ウェアラブル、ロボット、スマートホーム、自動車、マイコンを対象とした音声認識モデルである。依存関係なしでCPU上で動作し、同じコンテナと同じ量子化方式でNeedleと同じC++エンジンに読み込まれる。

言語は、ユーザーが指定しない限り自動検出される。30秒までの音声を一度に処理できる。

モデル構成とエンジン

エンコーダは8つのSimple Attentionブロック、デコーダは8つのLaddered Simple Attentionブロックで構成される。Whistleは単一のファイルとして配布され、Needleと同じエンジンに読み込まれる。

エンジンは、needle_load で .cact ファイルが保持するモデルを読み込む。また、エンジンは環境変数を一切読み込まない。

重みはHugging Faceで公開されている。エンジンとプラットフォーム別のフォルダはCactus-Compute/needle3にあり、ソースコードはGitHubに掲載されている。

ベンチマーク結果

ベンチマークでは、Whistleを Whisper base および Moonshine tiny v2 と比較した。Whistleの初回トークンまでの時間は、10秒の音声をApple M4 Pro CPUで処理した場合の値である。

項目WhistleWhisper baseMoonshine tiny v2
モデルサイズ16.9 MB145.3 MB41.9 MB
初回トークンまでの時間11.1 ms73.2 ms22.8 ms
デコード速度1,319 tokens/s266 tokens/s262 tokens/s

単語誤り率は86,174発話を対象に測定された。Whistleが優れた結果を示したテストセットと、Whisper baseが優れた結果を示したテストセットは次のとおりである。

同社は、報告されたすべてのテストセットについて音声のチェックサムと話者IDを比較し、テスト音声がWhistleの学習データや検証データに含まれていないことを確認したとしている。

筆者の見立て

この記事は元記事の事実のみに基づいて自動生成されました。

出典

この記事をシェア