動画の文字起こし

どんな動画も数秒でタイムスタンプ付きのテキストに。読む・検索する・字幕として書き出す、そのまま使えます。

100+ Languages
MP4 / MOV / AVI / MKV
TXT / SRT / VTT
10 Min Free
サンプル動画(カンファレンス講演)の一場面0:26

[サンプル]カンファレンス講演・1080pの画面録画

00:00:03みなさんが最初に聞くのは、結局その時間はどこへ消えているのか、という質問です。

00:00:11実際に測ってみました。およそ4割が、誰の目にも触れない作業に費やされています。

00:00:19そして人を増やす前に自動化できるのは、まさにその部分なんです。

00:01

動画の中の言葉をテキストにする意味

情報は動画の中にある。そして、そこに閉じ込められている

録画したワークショップ、顧客インタビュー、2時間の戦略会議。チームのいちばん価値ある思考は、紙の上ではなくカメラの前で生まれるようになりました。

けれど動画ファイルは中身が見えません。検索もできず、引用もできず、ざっと目を通すことも、一行をドキュメントに貼ることもできない。話された内容はすべて再生の向こう側にあり、再生は実時間という一つの速度でしか進みません。

動画ファイルの中に閉じ込められた音声波形と吹き出しが、ドキュメントと虫めがねの側から届かない様子のイラスト

文字起こししないまま放置する3つのコスト

どれも費目として表に出ないため、見過ごされがちです。表に出るのは「いつのまにか実行されない仕事」という形でしかありません。

検索流入の損失

検索エンジンが索引するのは言葉であって波形ではありません。文字起こしのない1時間の動画は、誰にも検索で見つけてもらえない1時間ぶんの専門コンテンツです。

アクセシビリティの損失

耳が聞こえない方や聞こえにくい方、音を出せない環境の方、母語以外で見ている方には、テキストが必要です。なければ、その人たちはただ離脱します。

再利用機会の損失

録画1本には記事1本、ニュースレター1通、そしてSNS用の切り抜き十数本ぶんの素材が入っています。言葉を取り出す作業が手作業のままなら、そのどれも作られません。

プロによる人力の文字起こしは1分あたり2ドルから。2時間の録画1本を書き起こすだけで240ドルです。この価格なら判断は自明で、ほとんどの録画は最初から文字起こしされません。AIによる文字起こしはこの計算を1分数セントに変えます。すべてを文字起こしするという選択が現実的になるのは、そのためです。

00:02

動画の文字起こしツールとは

動画の文字起こしツールとは、動画ファイルから音声トラックだけを取り出し、音声認識によって話された言葉を文章に変換するツールです。通常はタイムスタンプが付き、各行が動画のどの瞬間の発言かをたどれるようになっています。

AIによる動画文字起こしの仕組み

ファイルを渡してから結果が返るまでに、3つの処理が走ります。この3つを知っておくと、精度を左右する要因のほとんどが説明できます。

ステップ1 — 音声の抽出

動画ファイルは実際には映像と音声という2つのストリームが束ねられたものです。ここで必要なのは音声だけなので、映像トラックは最初に切り離されます。動画の文字起こしが音声と同じ料金なのはこのためで、映像は処理が始まる前に捨てられています。

ステップ2 — 音声認識

音声を、音と言葉を対応づけるモデルに通します。現在のモデルは訛りや発言の重なり、複数言語の混在を、10年前の音声入力よりはるかにうまく扱います。それでも、元の音声がクリーンであることに勝る条件はありません。

ステップ3 — 句読点・タイムスタンプ・話者の切り替え

認識直後の出力は、切れ目のない語の連なりです。最後の処理で文の区切りと表記が整えられ、各行がいつ話されたかを示すタイムコードが付きます。

動画ファイルが映像トラックと音声トラックに分かれ、音声トラックがテキストに変わる様子を示した図

文字起こし・字幕・クローズドキャプションの違い

この3つはしばしば同じ意味で使われますが、別物です。どれが必要かによって、書き出すべき形式が決まります。

文字起こし

話された内容の全文を、読み物として整えたもの。検索、引用、議事録、記事化に向いています。

字幕

同じ言葉を短い行に切り、再生に合わせて画面に出すもの。SRTやVTTで書き出し、視聴者に音が聞こえている前提です。

クローズドキャプション

字幕に加えて、笑い声・音楽・ドアの音といった発話以外の情報も含めたもの。本当の意味でのアクセシビリティ対応にはこちらが必要です。

00:03

動画を文字起こしする3ステップ

処理はすべてブラウザ上で完結します。インストールは不要で、事前に音声を抜き出しておく必要もありません。

3ステップの流れ:動画をアップロード、AIで文字起こし、テキストを書き出し

ステップ1 — 動画ファイルをアップロード

ファイルをドラッグするか、ディスクから選ぶだけです。ブラウザから直接ストレージへ送られるため、容量の大きい録画でも途中のサイズ制限に引っかかりません。アップロード中は進捗が表示されます。

対応フォーマット

MP4・MOV・AVI・MKV・WebMで、カメラ・スマートフォン・画面録画ソフトが出力するものはほぼ網羅しています。先にMP3へ書き出してから文字起こしする、という二段構えは不要です。音声トラックは自動で抽出されます。

サイズと長さの上限

1ファイルあたり120分まで、有料プランでは1本あたり2GBまで。目安として2GBは1080pでおよそ30分、480pなら2時間ぶんに相当します。無料アカウントは10分までのファイルに対応します。

ステップ2 — AIに文字起こしさせる

アップロードが終わり次第、処理が始まります。10分の動画なら通常1分以内に返ってきます。長い録画は内部で分割して処理し、結果を結合するので、2時間のファイルでも2分のファイルと同じ手順で扱えます。

言語の指定について

話されている言語は100以上の言語から自動で判定されるため、設定が必要になることはほとんどありません。途中で言語が切り替わる録画でも、それぞれの箇所が実際に話された言語のまま書き起こされます。

精度を上げるためにできること

認識精度を決めるのは録音であって、文字起こしツールではありません。そのまま公開できる文字起こしと、書き直しが必要な文字起こしを分けるのは、次の4点でほぼ説明できます。

部屋ではなく声を録る

話し手の近くに置いたピンマイクやヘッドセットは、机の向こう側に置いた高価なマイクに勝ります。距離こそが室内の反響と環境音を呼び込む原因で、いったん入ってしまった音は、最初から入れないほどきれいには取り除けません。

発言が重ならないようにする

2人が同時に話すことは、結果が崩れる最も多い原因です。インタビューや座談会の収録では、回答の前にひと呼吸置くだけで、目に見えて結果が良くなります。

BGMは先に取り除く

会話の下に敷かれた音楽は、エアコンのような一定のノイズよりずっと認識を妨げます。素材にBGMが入っている場合は、文字起こしの後ではなく前に取り除いてください。

固有名詞と専門用語は直す前提で

製品名・社名・専門用語は、精度97%の文字起こしでも粗が出るところです。書き出したテキストに置換をかければ1分もかからず片付きますし、字幕にする前に済ませておく価値があります。

ステップ3 — 確認して書き出す

結果はタイムスタンプ付きのセグメントに分かれて表示され、その場で読んで直せます。どの形式も同じ結果から書き出されるため、1回の文字起こしから複数の形式を持ち出せます。

ドキュメント用のTXT

タイムコードあり・なしを選べるプレーンテキスト。議事録、検索、引用、記事の下書きに使うならこちらです。

字幕用のSRT・VTT

YouTube、Premiere、Final Cut、各種プレーヤーにそのまま読み込める字幕ファイル。動画と一緒にSRTをアップロードすれば、追加の編集なしで字幕が表示されます。

00:04

文字起こしのあとにできること

文字起こし自体が目的であることは、実はほとんどありません。そのあとの4つの作業を安くするための工程であり、価値の大半はそちらに現れます。

1本の動画を5つの素材に変える

言葉がテキストとして存在した瞬間から、その録画は「納品物」ではなく「素材」になります。

ウェビナーから記事へ

45分のウェビナーの文字起こしは、3,000語ぶんの下書きです。白紙から書き始めるより、削って整える方が速く終わります。

エピソードのショーノート

タイムスタンプ、言及されたリンク、印象的な発言を3つ拾うだけ。聞き直す代わりに20分で終わります。

長尺からSNS用の切り抜きへ

テキストを見渡して切り出す価値のある箇所を探し、タイムコードで編集画面の該当位置へ一発で飛べます。

1本の動画が記事・ショーノート・SNS切り抜き・字幕・吹き替え版へ枝分かれする図

字幕をつけて海外の視聴者に届ける

SRTを書き出せば、音を出さずに見られる動画になります。SNS上の動画のかなりの割合は、そもそもそうやって見られています。字幕ファイルを索引するプラットフォームでは、検索にも掛かるようになります。

16言語に吹き替える

字幕は動画を別の言語で「読ませる」ものです。吹き替えは「聞かせる」もので、しかも元の話者の声質を保ったまま届けられます。すべてが共通のクレジット残高で動くため、いま支払った文字起こしのぶんを二重に払う必要はありません。

AI吹き替えを試す →

ノイズの多い音声は先に整える

走行音、空調、会話の下のBGMがある録音では、文字起こしが始まる前の段階で精度が落ちています。先にノイズを取り除くことは、たいていの場合いちばん費用対効果の高い改善です。

ボイスアイソレーターを試す →

00:05

動画の文字起こしの料金

文字起こしの料金は、共通のクレジット残高から素材の分数ぶんだけ引かれます。ユーザー単位の課金も、文字起こし専用の別サブスクリプションもなく、同じ結果を複数の形式で書き出しても追加料金はかかりません。

動画の文字起こし1分あたりの料金

1分あたり500クレジット。解像度やファイルサイズは関係ありません。課金の基準は録画の「長さ」であって「重さ」ではないため、4Kの画面録画とスマートフォンの動画が同じ長さなら、料金もまったく同じです。

プラン料金クレジット文字起こしできる長さ1分あたり
無料$05,000(初回のみ)約10分無料
Basic$9.99/月50,000約1.6時間$0.100
Standard$19.90/月100,000約3.3時間$0.100
Professional$49.90/月350,000約11.6時間$0.071
Premium$99.00/月800,000約26.6時間$0.062
Max$199.00/月2,000,000約66.6時間$0.050

文字起こしの単価はどのプランでも1分500クレジットです。上位プランほど実質単価が下がるのは、含まれるクレジットが料金以上に増えるためです。年額払いならさらに20%引きになります。

同じクレジットが全機能に使える

クレジットは機能ごとに割り当てられていません。文字起こしに使う残高がそのまま、その動画を別の言語に吹き替えることにも、原稿をナレーションにすることにも、ノイズの多い音声を整えることにも、ポッドキャストの生成にも使えます。文字起こしが多く吹き替えが少ない月と、その逆の月で、費用はまったく同じです。手の届かない枠の中で未使用のまま失効するぶんがありません。

できることレート50,000クレジットの目安
動画・音声の文字起こし500クレジット / 分約1.6時間ぶん
16言語へのAI吹き替え12,000クレジット / 分約4分ぶん
音声の分離・ノイズ除去タスク単位文字起こしの前に通すと精度が上がる
テキスト読み上げ文字数単位編集した原稿を音声に戻す

まず10分ぶん無料で試す

新規アカウントには5,000クレジット、およそ10分ぶんの文字起こしが付いています。デモ用の短いクリップではなく、実際の素材を一本通して結果を確かめるには十分な量です。クレジットカードの登録は不要で、同じクレジットはサイト内の他のツールでもそのまま使えます。

00:06

AIによる文字起こしと手作業の比較

録画を手で書き起こすという選択肢は今も有効で、限られた用途では今もそちらが正解です。どの用途なのかを、はっきりさせておく価値があります。

AIによる文字起こし

待ち時間は数分、1分あたり0.05〜0.10ドル、クリーンな単一話者の音声なら精度95%以上。100本たまっていても、追加の段取りなしにそのまま流せます。

人力の文字起こし

待ち時間は数時間から数日、1分あたり約2ドル、難しい音声でもほぼ完璧な精度。ファイル単位の課金なので、本数が増えればその分だけ費用も増えます。

動画からテキストへ至る短い自動経路と、長く曲がりくねった手作業の経路を対比したイラスト

速さ

慣れた人でも、音声1時間につき4時間ほどかかります。同じファイルがツールからは数分で返ってくる。この差が、録画を文字起こしするか「手間に見合わない」と判断するかの分かれ目になります。

費用

1分2ドルに対して0.05〜0.10ドル。人力は20〜40倍の費用がかかります。インタビュー1本ならその差は許容できます。ただしシリーズ全話となると、その作業が実行されるかどうかを左右します。

人力の方が優れている場面

求められる精度は用途によって違い、そこを一律に語っても誰の役にも立ちません。人が担当すべき素材は確かに存在します。

裁判記録、医療の口述、強い方言、複数人が同時に話す録音。こうした素材では、今も人の書き起こしがどのモデルよりも優れています。現実的な折衷案は、まずAIに通してから人が直す方法です。95%の下書きを直す方が、ゼロから打ち込むよりはるかに速く終わります。

00:07

よくある質問