文字起こし精度が悪いとき、すぐにサービスを変更する必要はありません。原因は、AIモデルだけでなく、録音距離、部屋、会話方法、設定、用語に分かれます。
改善は、録音前、文字起こし前、文字起こし後の順で考えます。
原因1:マイクが話者から遠い
声が小さく、部屋の反響や雑音の割合が増えます。中央に一台置くより、主要話者に近づける、複数マイクを使う、オンライン参加者の音声を別経路で記録する方法を検討します。
原因2:机の振動や接触音
キーボード、ペン、資料、コップの音がマイクへ直接伝わります。柔らかい台を使い、機器へ触れない位置に置きます。
原因3:空調・店内音・道路音
一定の雑音でも声の周波数と重なると認識しにくくなります。空調吹出口やスピーカーから離し、静かな部屋を選びます。
原因4:部屋の反響
広い会議室、ガラスや硬い壁が多い部屋では声が重なります。話者へ近づけ、カーテンや吸音性のある環境を選びます。
原因5:複数人が同時に話す
二人の声が同時に入ると、単語の欠落や話者ラベルの入れ替わりが起きやすくなります。進行役が順番を整え、重要な決定は一人が読み直します。
原因6:言語設定が違う
日本語の会議を別言語として処理すると、固有名詞以前に一般語も崩れます。多言語会議では主言語と切替条件を確認します。
原因7:固有名詞・専門用語が多い
人名、社名、製品名、略語は一般語へ置き換わりやすい項目です。語句登録やモデル適応に対応するサービスでは、認識させたい語を事前に指定できます。Google Cloudの公式資料でも、珍しい語句や固有名詞へのモデル適応が説明されています。
原因8:電話やスピーカー再生を録音している
スピーカーから出た音を別のマイクで録ると、圧縮、反響、雑音が重なります。可能なら会議サービス側の録音・文字起こし、通話対応機器、音声分離を使います。
原因9:音声形式やチャンネルが合わない
ステレオや複数チャンネルの扱いはサービスごとに異なります。変換時に片方の音声を失っていないか、再生して確認します。
原因10:AI出力を無修正で完成扱いする
精度が高くても、金額、日付、固有名詞、否定表現の一件の誤りが業務へ影響します。用途別の確認項目を用意します。
3段階の改善チェックリスト
| 段階 | 確認すること |
|---|---|
| 録音前 | 距離、雑音、反響、電池、容量、同意 |
| 処理前 | 言語、話者数、専門用語、音声形式 |
| 処理後 | 名前、数字、否定、決定、担当、期限 |
改善効果の測り方
同じ3〜5分の音声を使い、修正した文字数だけでなく、固有名詞、数字、話者、決定事項の誤りを数えます。修正時間も記録すると、実務で使いやすい設定を判断できます。
まとめ
精度改善は、AIを替える前に録音条件を整えることから始めます。良い原音、正しい設定、重要箇所の人による確認がセットです。
会議をきれいに録音する方法と専門用語の認識を改善する方法も確認してください。
