WhisperSubTranslate

July 13, 2026 · View on GitHub

English | 한국어 | 日本語 | 中文 | Polski

動画をローカルで多言語字幕にします。動画を入れると whisper.cpp で SRT を生成し、バンドルされた Hy-MT2 モデルでオフライン翻訳するか、無料/有料のオンラインエンジンで翻訳します。

このアプリは動画の音声から新しい字幕を作成します(音声認識)。埋め込み字幕トラックの抽出や画面文字の読み取り(OCR)は行いません。

プレビュー

WhisperSubTranslate メイン画面

主な機能

  • 音声認識は 100% ローカルで動作。動画が PC の外に出ず、アカウントもアップロードも不要。
  • バンドルの Hy-MT2 モデルでオフライン翻訳、または自分のキーでオンラインエンジン(MyMemory, DeepL, OpenAI, Gemini)を利用。
  • モデル自動ダウンロード。Python のインストールや手動設定は不要。
  • 通常モデルで同期がずれる動画向けの同期補正モデル(large-v2 同期、同期ライト)を搭載。
  • キュー、リアルタイム進捗、ローカル専用の処理履歴。

はじめに

ユーザー

Releases から最新のポータブル版をダウンロードし、展開して WhisperSubTranslate.exe を実行します。字幕抽出は PC 上で完全オフラインで動作します。翻訳は任意です。

開発者

npm install
npm start
  • Node.js 20.19 以上または 22.12 以上 (Electron 42 ビルドツールチェーン)
  • whisper.cpp は npm install 時に自動ダウンロード (Windows は CUDA ビルド、約700MB)
  • FFmpeg は npm で同梱。選択した GGML モデルは初回使用時にダウンロード

Linux

sudo apt install cmake build-essential git ffmpeg   # Ubuntu/Debian
npm install   # whisper.cpp をソースからビルド
npm start

CUDA 高速化が必要な場合は npm install の前に NVIDIA CUDA Toolkit を入れてください。whisper.cpp の手動ビルド手順は CONTRIBUTING.md にあります。

Windows ビルド

npm run build-win   # 成果物は dist2/ に出力されます

翻訳エンジン

バンドルの Tencent Hy-MT2 モデルで完全オフライン翻訳、または自分の API キーで無料/有料オンラインエンジンを使えます。

エンジンオフラインAPI キー費用備考
Hy-MT2 1.8B (ローカル、既定)はい不要無料約1.13GB、VRAM 2GB / RAM 4GB、オンデバイス
Hy-MT2 7B (ローカル)はい不要無料約6.16GB、VRAM 8GB / RAM 12GB、大型モデル
MyMemoryいいえ不要無料IP ごとに 1日 約5万文字
DeepLいいえ必要月50万文字 無料出力が安定
OpenAI GPT-5.4 miniいいえ必要有料文脈認識
OpenAI GPT-5.4 nanoいいえ必要有料より安価なティア
Gemini 3 Flashいいえ必要無料 / 低コスト推奨の低コスト経路 (キー取得)

ローカルの Hy-MT2 エンジンだけが API キーもネットワークも使用料も不要で、セリフが PC の外に出ません。

翻訳品質 (オフラインエンジン)

WhisperSubTranslate は Tencent Hy-MT2 モデル(既定 1.8B、オプション 7B)を同梱しています。Tencent の公式評価では、Hy-MT2 ファミリーは主要な商用翻訳 API と競合し、一部のベンチマークでは上回る結果を示しています。

Tencent Hy-MT2 公式ベンチマーク、WhisperSubTranslate 同梱モデル

出典: Tencent の公式ベンチマーク: Hy-MT2 リポジトリ, 技術レポート, HuggingFace モデル。上のグラフは Tencent 公式 Figure 1 を再描画したもので、同梱モデル(1.8B/7B)の数値は論文の表と照合しています。これらの数値は標準的な機械翻訳ベンチマーク(WildMTBench, WMT25, FLORES-200 など)でモデル自体を測定した結果であり、WhisperSubTranslate アプリ自体を再測定したものではありません。

長い動画(1時間以上)では MyMemory の1日制限で遅くなることがあります。その場合は Gemini、DeepL、設定済みの GPT モデルを使ってください。

音声認識モデル

モデルは必要に応じて _models/ にダウンロードされます。CUDA があれば GPU、なければ CPU で動作します。GPU に合うサイズを選んでください。

モデルサイズVRAM速度備考
tiny約75MB約1GB最速基本
base約142MB約1GB高速良好
small約466MB約1GB中速より良い
medium約1.5GB約2GB中速優秀
large-v3約3GB約4GB低速文字起こし最高
large-v3-turbo (既定)約809MB約2GB高速総合的に最も無難
large-v2 同期約4.4GB約4.5GB低速別エンジン、字幕同期を補正
large-v2 同期ライト共用約3GB低速同期と同じファイル、int8、低VRAM

同期と同期ライトは別の Faster-Whisper エンジン(初回に一度自動ダウンロード、約4.4GB)を使い、同じモデルファイルを共有するため、一度ダウンロードすれば両方使えます。通常モデルで同期がずれるときだけ使ってください。非英語の動画(日本語、韓国語、中国語)で最も正確で、英語は通常 large-v3-turbo で十分です。

whisper.cpp モデルの VRAM は GGML 最適化基準で、PyTorch Whisper(large 約10GB)よりはるかに少なめです。同期モデルの数値は Faster-Whisper ベンチマーク基準です。

言語サポート

  • UI: 韓国語、英語、日本語、中国語、ポーランド語
  • 翻訳対象(15言語): ko, en, ja, zh, es, fr, de, it, pt, ru, hu, ar, pl, tr, fa
  • 音声認識: whisper.cpp で100言語以上

データ保存

すべてのデータはユーザーフォルダにローカル保存され、アップロードされません。

データ場所
設定と API キー%APPDATA%\whispersubtranslate\translation-config-safe.json
処理履歴%APPDATA%\whispersubtranslate\history.json (最大200件)
エラーログ%APPDATA%\whispersubtranslate\logs\errors.log
モデル_models/ (アプリフォルダ)

API キーは OS のセキュア保存でローカルに保存され、設定ファイルは Git にも配布物にも含まれません。処理履歴は任意で(設定で切替)、最大200件まで保持されます。

貢献

Pull Request を歓迎します。ブランチ命名、コミット規約、手動テストチェックリスト、 whisper.cpp の手動ビルドは CONTRIBUTING.md を参照してください。 UI 言語または翻訳対象の追加は 翻訳ガイド を参照してください。

Weblate でアプリ UI の 翻訳に参加できます。UI 翻訳文字列は locales/*.json にあります。

貢献者

WhisperSubTranslate をより良くしてくれるすべての方に感謝します。

Blue-B matbgn AtillaTahak

支援

このプロジェクトが時間の節約になったら、支援はバグ修正やモデルの安定化、新しい翻訳オプションの開発に直接役立ちます。

GitHub Sponsors Buy Me A Coffee PayPal

謝辞

ライセンス

GPL-3.0。外部 API とサービス(DeepL, OpenAI, Gemini など)は各自の規約に従います。