CPUのみで動作するリアルタイム多言語音声認識「早耳」、GPUもクラウドAPIも使わずメモリ2GB未満でライブ字幕表示からブラウザ表示・話者ラベル付け・翻訳字幕まで可能

「Hayamimi(早耳)」はGPUやクラウドAPIに依存せずCPUのみで動作する軽量なリアルタイム多言語音声認識システムです。メモリ2GB未満の環境でもライブ字幕表示・話者ラベル付け・翻訳字幕生成まで対応し、発話中から字幕が出始め話し終えて約100msで確定する高速性が特徴です。
oboroge0/hayamimi: 早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
https://github.com/oboroge0/hayamimi
従来のCPUベースの音声認識は単一モデルに依存しがちでしたが、Hayamimiは発話ごとに言語を判定して最適な専用モデルに振り分ける独自のアプローチを採用しています。使用されるモデルはINT8量子化されたONNX形式でsherpa-onnx上で動作するためPyTorchやCUDAは不要で、実際のテレビ放送の日本語音声で「文字誤り率(Character Error Rate:CER) 3.8%」という高い精度を達成し、6コアのデスクトップCPUで実時間の10~50倍の速度を実現しています。
Hayamimiは以下の通り、多岐にわたる機能を備えています。
・5つの言語カタログ:5つの主要言語(日・中・韓・広東語・英)に加えて欧州24言語を専用モデルで処理、それ以外の約1600言語はMeta Omnilingual ASRにフォールバック
・ドラフト字幕:発話中に約0.5秒ごとにドラフトテキストを更新
・高速確定:日本語の場合、話し終えて約100msで確定文を出力
・二段パス補正:2秒の無音後に直前の発話を再デコードし「清書」トランスクリプトを生成、日本語CERを15.5%から12.0%に改善
・話者ラベル付け:「--speakers」オプションでCAM++によるリアルタイム話者タグ付け、清書パスでpyannote/segmentation-3.0による本格的な再分離を実施
・翻訳:「--translate」オプションで日本語字幕を指定言語(例: en・zh・ko・es)へリアルタイム翻訳
・ホットワード:「--hotwords」で固有名詞認識強化を実行
・置換辞書:「--replace」で事後検索置換を実行
・漢数字→算用数字変換:日・中・広東語で漢数字を算用数字へ変換
・実行時辞書API:セッション中に置換辞書やITN(Inverse Text Normalization)例外/強制指定を差し替え可能
・構造化イベント+実行時設定:EventHubにイベントを発行しパイプラインの各段階をリッスン可能
・OBSオーバーレイ+ダッシュボード:「--serve」でローカルHTTPサーバーを起動しブラウザソースオーバーレイとライブダッシュボードを提供
・ネットワーク音声入力:「--input ws」でWebSocket経由の音声入力を受け付け
・スピーカーループバック入力:「--input speaker」(Windows専用)でPC内部スピーカー音声、「--input mix」でマイクとスピーカー音声を合成したループバックストリームの文字起こしに対応
・英語v2ティア(オプトイン):「--en-tier v2」でParakeet TDT v2に切り替え、英語WERを10.0%から6.6%に改善
・4クラス日本語句読点(オプトイン):「--punct-model 4class」で句読点を直接予測する単一モデルに切り替え
・メモリ上限管理:LRUモデル退避により常駐モデルを上限内(既定は2GB)に制御
Hayamimiを動作させる場合、動作環境にはPython 3.10以上とPATHの通ったffmpegが必要です。まずは適切な場所にリポジトリをクローンします。
git clone https://github.com/oboroge0/hayamimi.git
次に仮想環境作成と依存関係インストールします。
python -m venv .venv
# Windowsの場合
.venv\Scripts\pip install -r requirements.txt
# macOS / Linuxの場合
.venv/bin/pip install -r requirements.txt
最後にモデルをダウンロードします。
# Windowsの場合
.venv\Scripts\python scripts/download_models.py
# macOS / Linuxの場合
.venv/bin/python scripts/download_models.py
「--minimal」オプションを指定すると日本語と英語のみの約1.1GB構成も可能となっています。
リアルタイム認識を実行するには以下のコマンドを実行します。
# マイク入力 (Windows)
.venv\Scripts\python scripts/realtime_transcribe.py
# マイク入力 (macOS/Linux)
.venv/bin/python scripts/realtime_transcribe.py
# PC内部スピーカー入力 (Windows専用)
.venv\Scripts\python scripts/realtime_transcribe.py --input speaker
# マイク+スピーカー合成入力
.venv\Scripts\python scripts/realtime_transcribe.py --input mix
# ダッシュボード+OBSオーバーレイ付き
.venv\Scripts\python scripts/realtime_transcribe.py --serve
なおHayamimiにはデモUIが用意されています。「--serve」オプションでローカルサーバーが起動し、ブラウザから以下の3ページにアクセスできます。
・http://localhost:8833/dashboard:ダッシュボード:発話中のテキスト・確定行・翻訳・清書版トランスクリプトが表示される
・http://localhost:8833/:OBSオーバーレイ:OBSのブラウザソースURLとして設定すると配信画面に字幕が表示される
・http://localhost:8833/transcript:トランスクリプトページ:清書版トランスクリプトのみを表示
記事作成時点でのHayamimiの制限事項は以下の通りです。
・1文中に複数言語が混在する発話には未対応
・効果音やBGM直後の短い発話では言語判定を誤ることがある
・同時に話す2人の話者は分離不可
・翻訳品質は小型モデルに依存するため、中国語・韓国語翻訳では数値や金額の間違いが発生する可能性あり
・オプトインの4クラス句読点モデルは既定では感嘆符「!」を出さない
Hayamimiは軽量かつ高速なリアルタイム多言語音声認識として、今後も目の離せない存在といえます。
・関連記事
リアルタイム文字起こしAI「MAI-Transcribe-2-Streaming」をMicrosoftがリリース - GIGAZINE
最大8人の話者を識別しつつリアルタイム文字起こしできるAIモデル「NVIDIA Nemotron 3 Diarization」がオープンモデルとして公開される - GIGAZINE
センサー刷新でヘルスケア機能強化&周囲の音声からAIで文字起こしや通知が可能な「Apple Watch Series 12」「Apple Watch Ultra 4」が登場 - GIGAZINE
「あー」「えー」などを自動削除しつつリアルタイムで文字起こししできる音声認識モデル「Gemini 3.5 Transcribe」をGoogleが発表 - GIGAZINE
OCR・音声・構造化出力などの定型タスクに特化したAIモデル「Interfaze」登場 - GIGAZINE
Alibabaがリアルタイムで音声会話できるAIモデル「Qwen3-Omni」やGPT-5と同等性能の画像認識AIモデル「Qwen3-VL」を公開、他にも言語モデルや画像編集モデルを一挙大量公開 - GIGAZINE
NVIDIAが音声AIの開発に役立つ100万時間の音声データセットを公開&実際にトレーニングした文字起こしAIモデルも公開 - GIGAZINE
商用利用可能なスタジオ級サウンドを生成できる「Eleven Music」をElevenLabsが発表 - GIGAZINE
1100以上の言語で音声からの文字起こしや文章の読み上げが可能な音声認識モデル「Massively Multilingual Speech(MMS)」をMetaが発表 - GIGAZINE
・関連コンテンツ
in AI, ソフトウェア, Posted by log1c_sh
You can read the machine translated English article 'Hayami,' a real-time multilingual speec….







