gpt-realtime-whisper
ライブ文字起こし デモ
gpt-realtime-whisper は OpenAI のストリーミング音声認識モデル。発話を待たずに逐次テキスト化されるため、議事録・字幕・カルテ下書きなど、会話進行と並行してテキスト処理を回したい場面に向きます。
モデル / API 仕様
| モデルリリース |
2026年5月7日
Realtime API: 2024年10月β / 2025年8月GA
|
|---|---|
| モダリティ | 音声 → テキスト(ストリーミング) |
| 出力形式 | delta(部分) + completed(確定) |
| 対応言語 | 99 言語(自動判定) |
| 接続方式 | WebRTC / WebSocket |
| 句読点・大文字化 | 自動付与 |
| 発話区切り | サーバ側 VAD で自動分割 |
| ノイズ抑制 | サーバ側で背景ノイズ低減 |
▶ 詳細パラメーター設定(言語・プロンプト・ノイズ抑制・logprobs)
ⓘ パラメータは デモ開始時に確定 します。録音中の変更は次回の「デモ開始」から反映されます。
精度向上のためのヒント。指定言語以外の発話もフィルタされませんが、強制マッピング(例: "thank you"→「サンキュー」)の可能性あり。多言語会話は自動検出推奨。
認識精度を上げたい固有名詞・専門用語・話者の口調などを入れる。会話文ではなく単語列でOK。
ヘッドセット・近接マイク向け(既定推奨)
ⓘ gpt-realtime-whisper は turn_detection(サーバ側 VAD)に非対応です。発話の区切りは句読点(。..!?!?)ベースで自動分割しています。
※ 接続には OpenAI API キーがサーバー側に設定されている必要があります。マイクの使用許可も求められます。
※ デモのため 1回の録音は最大 1 分 で自動停止します。続けて使う場合は再度「デモ開始」を押してください。
想定ユースケース
料金感(OpenAI 従量課金)
| 項目 | 料金 | 目安 |
|---|---|---|
| ストリーミング文字起こし | $0.017 / 分 | 1時間あたり約 $1.02 |
議事録・カルテ・字幕の自動化をカスタマイズ開発するには?
御社の業務フロー・既存ツール(Zoom / Teams / 電子カルテ / CRM)と統合した PoC・本番運用までご支援します。