話し終えて約0.1秒で字幕が確定。「早耳」の速さにハマる
- 公開
- 正式公開 2026-08-25
- 作り手
- oboroge0(個人)
- 対応
- Windows
- 言語
- 日本語・英語・中国語・韓国語・広東語
- 価格
- 無料(README の表記は MIT ライセンス)
- 評価
- GitHub のスター 347(2026-10-06)
どんなアプリか
hayamimi は、話している音声をその場で文字にするオープンソースのソフトです。GPU もクラウド API も使わずに CPU で動き、ライブ字幕、ブラウザで見るダッシュボード、話者ラベル、翻訳を備えています。
“早耳” (hayamimi) is Japanese for “quick ear” – someone who picks up on things fast. That’s the design goal: partial subtitles appear while you’re still talking, and a finalized line lands roughly 100ms after you stop.
oboroge0 さん、GitHub の README
話している途中は約0.5秒ごとに途中経過の字幕が更新され、日本語では話し終えてから約100ミリ秒で確定した行が出ると README に書かれています。
1つの汎用モデルに任せるのではなく、発話ごとに言語を判定して、その言語に向いた専用のモデルへ振り分けます。日本語・中国語・韓国語・広東語・英語と欧州の言語はそれぞれ専用モデルへ、それ以外の言語は Meta の Omnilingual ASR へ回します。
作者の計測では、実際の放送の日本語音声で文字誤り率(CER)3.8%(2026-09-01 に再計測)、同じ音声で whisper-large-v3-turbo は13.8%でした。いずれも作者自身による計測で、hayamimi が負ける言語も含めた比較は別の文書にまとめられています。
--serve を付けると手元で HTTP サーバーが立ち、ライブのダッシュボードと OBS のブラウザソース用オーバーレイが使えます。--translate では日本語の行をその場で英語などに翻訳します。
マイクのほか、PC で再生中の音(通話の相手側や動画)も文字にでき、マイクと合わせて会議の書き起こしにも使えます。この再生音の取り込みは Windows 向けの機能です。
料金とデータの置き場所
README のバッジでは MIT ライセンスと表示されています。使う学習済みモデルにはそれぞれのライセンスがあり、THIRD_PARTY_NOTICES.md に説明があります。
モデルは約3.1GB を手元の models/ フォルダに取り込みます。日本語と英語に絞る --minimal では約1.1GB です。書き起こしは --transcript で指定したファイルに追記できます。
同じ分野のアプリ
| 名前 | 型 | 仕掛け | 対応 | 料金 |
|---|---|---|---|---|
| hayamimi(早耳) | ローカル文字起こし | CPU で動き、言語ごとの専用モデルに振り分けてリアルタイムに字幕を出す | Windows | 無料(MIT ライセンス表記) |
| mocoVoice MCPサーバー | MCP サーバー | 音声認識 AI の mocoVoice を AI エージェントから呼び出し、音声・動画を書き起こして分析する | MCP(GitHub公開) | MCP経由で300分まで無料、以降は未確認 |
入れる前に
Python 3.10 以上と ffmpeg が必要です。開発と動作確認は Windows 11 で行われていて、macOS と Linux は動く見込みとされていますが、通しのテストはまだです。
固有名詞を認識しやすくする --hotwords は、いまのところ日本語では効きません。日本語の固有名詞には、出力を置き換える --replace の辞書を使います。
スマートフォンなどから音声を送る --input ws は、初期設定では自分の PC からの接続に限られます。受け口には認証が無いため、LAN に開くのは信頼できるネットワークに限るよう書かれています。