号 > AI

話し終えて約0.1秒で字幕が確定。「早耳」の速さにハマる

hayamimi(早耳)
GPU もクラウド API も使わず、CPU で動く多言語のリアルタイム文字起こし
GitHub
公開
正式公開 2026-08-25
作り手
oboroge0(個人)
対応
Windows
言語
日本語・英語・中国語・韓国語・広東語
価格
無料(README の表記は MIT ライセンス)
評価
GitHub のスター 347(2026-10-06)

どんなアプリか

hayamimi は、話している音声をその場で文字にするオープンソースのソフトです。GPU もクラウド API も使わずに CPU で動き、ライブ字幕、ブラウザで見るダッシュボード、話者ラベル、翻訳を備えています。

“早耳” (hayamimi) is Japanese for “quick ear” – someone who picks up on things fast. That’s the design goal: partial subtitles appear while you’re still talking, and a finalized line lands roughly 100ms after you stop.

oboroge0 さん、GitHub の README

話している途中は約0.5秒ごとに途中経過の字幕が更新され、日本語では話し終えてから約100ミリ秒で確定した行が出ると README に書かれています。

1つの汎用モデルに任せるのではなく、発話ごとに言語を判定して、その言語に向いた専用のモデルへ振り分けます。日本語・中国語・韓国語・広東語・英語と欧州の言語はそれぞれ専用モデルへ、それ以外の言語は Meta の Omnilingual ASR へ回します。

作者の計測では、実際の放送の日本語音声で文字誤り率(CER)3.8%(2026-09-01 に再計測)、同じ音声で whisper-large-v3-turbo は13.8%でした。いずれも作者自身による計測で、hayamimi が負ける言語も含めた比較は別の文書にまとめられています。

--serve を付けると手元で HTTP サーバーが立ち、ライブのダッシュボードと OBS のブラウザソース用オーバーレイが使えます。--translate では日本語の行をその場で英語などに翻訳します。

マイクのほか、PC で再生中の音(通話の相手側や動画)も文字にでき、マイクと合わせて会議の書き起こしにも使えます。この再生音の取り込みは Windows 向けの機能です。

料金とデータの置き場所

README のバッジでは MIT ライセンスと表示されています。使う学習済みモデルにはそれぞれのライセンスがあり、THIRD_PARTY_NOTICES.md に説明があります。

モデルは約3.1GB を手元の models/ フォルダに取り込みます。日本語と英語に絞る --minimal では約1.1GB です。書き起こしは --transcript で指定したファイルに追記できます。

同じ分野のアプリ

名前型仕掛け対応料金
hayamimi(早耳)ローカル文字起こしCPU で動き、言語ごとの専用モデルに振り分けてリアルタイムに字幕を出すWindows無料(MIT ライセンス表記)
mocoVoice MCPサーバーMCP サーバー音声認識 AI の mocoVoice を AI エージェントから呼び出し、音声・動画を書き起こして分析するMCP(GitHub公開)MCP経由で300分まで無料、以降は未確認

入れる前に

Python 3.10 以上と ffmpeg が必要です。開発と動作確認は Windows 11 で行われていて、macOS と Linux は動く見込みとされていますが、通しのテストはまだです。

固有名詞を認識しやすくする --hotwords は、いまのところ日本語では効きません。日本語の固有名詞には、出力を置き換える --replace の辞書を使います。

スマートフォンなどから音声を送る --input ws は、初期設定では自分の PC からの接続に限られます。受け口には認証が無いため、LAN に開くのは信頼できるネットワークに限るよう書かれています。