ツール一覧 / AI活用ノート / AI文字起こし精度比較|Whisper・Notta・Googleを日本語の会議で

AI文字起こし精度比較|Whisper・Notta・Googleを日本語の会議で

2026-09-28検証読了 約8分

日本語の会議音声で、Whisper・Notta・Google Speech-to-Textはどれくらい間違えるのか。公開されている評価値と各社の公式表記を並べ、自分の会議音声で誤りの数を数える手順までまとめました。

結論: 日本語の会議音声は、「整った発言」と「かぶった雑談」で誤りの量が数倍変わります。ツールを選ぶ前に、自分の会議を1本だけ通して誤りを数えるのが一番早い。

  • とりあえず自分の声の通り方を見たい → Nottaの無料枠(月120分・1回3分)
  • 2時間の会議を丸ごと回したい → Whisper(MITライセンス。手元のPCで動く)
  • 社内システムに組み込みたい → Google Cloud Speech-to-Text(日本語ja-JPは正式提供)

議事録の文字起こしをAIに投げて、戻ってきたテキストを見て固まった経験。あれは、たいてい音声のせいです。ツールを変える前に、どこで何回間違えたかを数えると話が早く進みます。

同じAIでも、音声の種類で誤りの量が変わる 原稿を読み上げた音声 一人・無音・言い直しなし 誤りは少ない 司会がいる会議・講演 順番に話す・フィラーあり そこそこ増える 雑談混じりの打合せ 声がかぶる・小声・専門用語 一気に増える
この記事の目次
  1. 会議の音声だと、AIはどれくらい間違えるのか
  2. Whisper・Notta・Googleは、そもそも何が違うのか
  3. 自分の会議音声で「誤りの数」を数える手順
  4. 結局いくらかかるのか(無料枠でどこまで届くか)
  5. 誤りが出る場所は、だいたい決まっている
  6. よくある質問
  7. 次に読むなら
  8. この記事のまとめ

会議の音声だと、AIはどれくらい間違えるのか

先に結論。読み上げ音声の評価値を見て「ほぼ完璧」と思っていると、会議音声で落差にやられます。

ソニーグループの研究チームがarXivで公開した多言語ASRモデルの論文に、日本語話し言葉コーパス(CSJ/学会講演と模擬講演の録音)での比較表があります。ここでのWhisper large-v3の文字誤り率は16.5〜18.4%。100文字書き起こして16〜18文字ずれる計算です。

正直、この数字は見た瞬間に「思ったより高い」と感じました。CSJはフィラー(「えー」「あのー」)や言い直しが多く、雑に言えば「一人がしゃべる会議」に近い音声です。読み上げ音声のベンチマークだけ見ていると、まったく別物に見えます。

Notta側の説明はもっと具体的でした。公式ブログには、整然と発言するフォーマルな会議で認識率90%以上、軽いミーティングや打合せでは50〜80%程度、と書かれています。トップページの「98%+ Accuracy Guaranteed」とは別に、この幅をちゃんと出しているのは誠実だと思います。

音声の種類 公表されている目安 出どころ
学会講演・模擬講演 文字誤り率 16.5〜18.4%(Whisper large-v3) ソニーグループの論文(arXiv)
整然としたフォーマルな会議 認識率 90%以上 Notta公式ブログ
軽いミーティング・打合せ 認識率 50〜80%程度 Notta公式ブログ

← 表は横にスクロールできます →

指標も測定条件も違うので、横に並べて優劣は付けられません。それでも共通して言えるのは、会議の種類のほうがツールの差より大きいということです。

Whisper・Notta・Googleは、そもそも何が違うのか

3つは競合というより、立ち位置が違います。使う側が用意するもの(お金・時間・技術)が全部ちがう。

3つは「誰が何を用意するか」が違う Whisper 自分で動かす MITライセンス PCの中で完結できる 環境構築の手間 話者分けは別途 Notta 使うだけ Web会議と連携 話者分け・要約つき 音声を預ける形 無料枠は1回3分 Google STT 組み込む 日本語は正式提供 話者分離に対応 単語単位の時刻なし 画面がない
OpenAI Whisperの公式リポジトリ
OpenAI Whisperの公式リポジトリ(github.com・2026-10-01時点の画面)

Whisperは公式リポジトリでtiny/base/small/medium/large/turboの6サイズが公開されています。コードもモデルの重みもMITライセンス。largeは10GB程度のVRAMが要る一方、turboは約6GBで速度はlargeの8倍程度と書かれています。

Nottaの公式トップページ
Nottaの公式トップページ(notta.ai・2026-10-01時点の画面)

Nottaは58言語対応をうたい、Zoom・Google Meet・Microsoft Teams・Webexとの連携を掲げています。リアルタイム文字起こしもあります。文字起こしそのものより、会議に自動で入って勝手に録る部分が本体だと思ったほうが実態に近い。

Google Cloud Speech-to-Textの公式ページ
Google Cloud Speech-to-Textの公式ページ(cloud.google.com・2026-10-01時点の画面)

Googleは最新世代のChirp 3で、日本語(ja-JP)が文字起こし・話者分離ともに一般提供(GA)になっています。自動句読点、自動言語検出、ノイズ低減もGA。ただし単語単位のタイムスタンプと単語単位の信頼度スコアは非対応です。

ここは地味に効きます。動画の字幕を1語ずつ動かしたい制作案件だと、この一点でGoogleが外れることがある。一方Whisperは、whisper-1系で単語またはセグメント単位のタイムスタンプが取れます。

自分の会議音声で「誤りの数」を数える手順

他人のベンチマークは参考値です。あなたの会議室の反響と、あなたの業界の固有名詞では結果が変わります。だから数えます。

誤りを数える手順 1. 見本を作る 同じ音声の3分を 手で正しく書く 2. 3つに通す 同じファイル 同じ言語設定 3. ずれを数える 置き換わった字 消えた字・増えた字 4. 割り算する ずれの合計 ÷ 見本の文字数 文字誤り率(CER)= (置き換わった + 消えた + 増えた) ÷ 見本の文字数 例:見本600文字に対して、ずれが合計60文字 → 10% 日本語は単語の切れ目が曖昧なので、単語単位(WER)より文字単位が扱いやすい

正解となる見本(正解テキスト)を手で作るのが一番しんどい工程です。3分あれば十分。10分作ると心が折れます。

数えるときのコツは、種類ごとに分けて数えること。合計のパーセントだけ見ても、直す手間が想像できません。固有名詞のミスは辞書登録で潰せますが、声のかぶりによる脱落は録り方を変えるしかない。原因が違えば打ち手も違います。

比較するときは条件を揃えてください。同じファイル、同じ言語指定、同じ話者数。片方だけ用語登録を入れると、それはツールの比較ではなく設定の比較になります。

結局いくらかかるのか(無料枠でどこまで届くか)

月に何時間の会議を回すかで、答えがきれいに割れます。2026-09-28時点の各社公式ページの表記です。

月に何時間の会議を文字起こしするか まず自分の時間を数える 月2時間まで Nottaの無料枠で 様子を見る 1回3分の壁あり 月30時間まで Nottaの有料プラン が素直 連携と要約が付く それ以上 Whisperを手元で 回すほうが安い 構築の時間は要る
無料でできる範囲 有料の入口 引っかかりやすい制限
Whisper(自分のPC) 制限なし(MITライセンス) 0円(電気代と機材) largeは約10GBのVRAM
Whisper API(OpenAI) なし $0.006/分 1ファイル25MBまで
Notta 月120分・1回3分 年払い月1,185円で月1,800分 1回5時間まで
Google Speech-to-Text 月60分(V1 API) 従量課金 最新価格は公式ページで確認

← 表は横にスクロールできます →

Nottaのプレミアムは年払いで月1,185円。時給3,000円で請求している人なら、月に24分浮けば元が取れます。会議1本の書き起こし直しが30分かかるなら、1本目で回収できる計算です。

無料枠の落とし穴は「1回3分」のほう。月120分あっても、1時間の会議は1本も通りません。App Storeのレビューにも「お試しは3分だけです」と書いた投稿があり、会議の途中で止まって慌てた話が添えられていました。

OpenAIのAPI側は1ファイル25MBの上限があります。長い会議は分割が前提。ここは最初に知っておくと、あとで慌てません。

誤りが出る場所は、だいたい決まっている

パーセントより、こっちのほうが実務では役に立ちます。ずれる場所には偏りがある。

誤りが集中する4か所と、打てる手 固有名詞・社内用語 社名、人名、案件コード、略語 → 用語登録・キーワード指定で減らせる 同音異義語 「ノッタ」が「乗った」になる類 → 置換ルールで一括修正 声のかぶり 相づち、二人同時、遠い席の発言 → 録り方を変えるしかない 言い直し・フィラー 「えー、あの、つまりですね」 → 要約側で吸収する前提に

Notta公式ブログのサンプル検証でも、「Notta」を「乗った」と認識した以外は正確に書き起こせた、という書き方をしています。逆に言えば、固有名詞さえ潰せば残りは読めるということです。

App Storeのレビューには「文字起こしの精度はあまりよいとは言えません。専門用語は特にとらえられないようです」という声もありました。用語登録を入れる前と後で、体感がかなり変わる領域だと思います。

対処の順番としては、辞書・キーワード指定が先。次にマイクの位置。モデルを大きくするのは最後でいい、というのが調べた範囲での印象です。

なお、社内の会議音声をクラウドに上げる話は別の判断が要ります。Nottaは公式のセキュリティページでISO 27001、SOC 2 Type II、GDPR・APPI対応を掲げ、バックアップデータは国内のデータセンターで保存すると書いています。手元で完結させたいならWhisperをローカルで動かす選択になります。

よくある質問

Q. 無料のまま1時間の会議を文字起こしできますか

Nottaの無料枠は1回3分までなので、そのままでは通りません。手元のPCでWhisperを動かす方法なら、長さの制限はモデルとPCの性能次第になります。

Q. Whisperはどのサイズを選べばいいですか

公式リポジトリの表では、largeが約10GBのVRAM、turboが約6GBでlargeの8倍程度の速度とされています。会議音声を数多く回すなら、まずturboで誤りを数えてから判断するのが手堅い。

Q. 話者ごとに分けたいときは

GoogleのChirp 3は日本語の話者分離がGA(BatchRecognizeまたはRecognizeメソッド)です。Nottaは話者識別が機能に含まれています。OpenAI側は話者分離に対応した専用モデルが用意されています。

次に読むなら

この記事のまとめ

出典

  1. openai/whisper(モデル一覧・VRAM・ライセンス)OpenAI / GitHub / 2026-09-28参照
  2. API Pricing(音声文字起こしモデルの分単価)OpenAI / 2026-09-28参照
  3. Speech to text(ファイルサイズ上限・タイムスタンプ・話者分離モデル)OpenAI / 2026-09-28参照
  4. Notta 料金プラン(無料枠120分・1回3分/プレミアム月1,185円)Notta / 2026-09-28参照
  5. Notta 公式トップページ(98%+ Accuracy・58言語・Web会議連携)Notta / 2026-09-28参照
  6. Nottaの文字起こし精度(会議形式ごとの認識率・「乗った」の誤認識例)Notta / 2026-09-28参照
  7. Notta セキュリティ(ISO 27001・SOC 2 Type II・国内データセンター保存)Notta / 2026-09-28参照
  8. Chirp 3(ja-JPの文字起こし・話者分離の提供状況、単語単位タイムスタンプ非対応)Google Cloud / 2026-09-28参照
  9. Google Cloud 無料枠の一覧(Speech-to-Text V1 APIの月60分)Google Cloud / 2026-09-28参照
  10. Whale: Large-Scale multilingual ASR model(CSJでのCER比較表 Table 3)Sony Group Corporation / arXiv / 2026-09-28参照
  11. Notta アプリのApp Storeレビュー(精度・専門用語・無料版3分の制限)Apple / App Store / 2026-09-28参照