MP4 转文字, 不用绕道 MP3
把 MP4 丢进来,取出里面的话。音轨会自动从容器里剥出来,中间不需要导出 MP3 这一步,也不会因为二次压缩掉音质。
你手上剩下的,几乎总是一个 MP4
手机、录屏软件、会议工具、微单相机 —— 让几乎任何设备拍段视频,落到硬盘上的都是 MP4。它能占住这个位置,是因为它是那个到哪儿都能播、谁都不用多想的容器。
而这份普及,也正是这么多人早晚要把 MP4 转成文字的原因。那段录制从来不是为了转成文字才拍的,它只是记录当时那一刻的设备的默认输出。
所以在把 MP4 转成文字之前,有件事值得先弄明白:MP4 是容器,不是编码。里面装着两条互相独立的流 —— 画面通常是 H.264 或 H.265,声音通常是 AAC。下面所有的事,都是从这一点推出来的。
95% 的体积是画面
在一个典型的 MP4 里,视频流的体积把音频流压得几乎看不见。而你想从转写里拿到的一切,全在那承载声音的几个百分点中。
只有音频会被读
视频流在识别开始之前就被丢掉了。同样长度的 4K 文件和 480p 文件,会给出同样的稿子、同样的价格。
格式很少是你选的
MP4 是设备直接给你的。这也意味着里面的声音是为「看」而录的,不是为「读」而录的 —— 准确率的高低就从这里来。
真正的限制是体积
先卡住你的很少是分钟数。手机拍的视频,会在离时长上限还很远的时候就撞上体积上限。
把 MP4 转成文字,实际做的是什么
把 MP4 转成文字,是指把文件解复用 —— 将其中的音频流与视频流分离 —— 然后只对音频做语音识别。画面在转写开始之前就被丢弃,所以分辨率既不影响价格,也不影响结果。
从这个定义能推出四件事,合起来基本能回答大家在上传第一个文件之前会问的绝大多数问题。
- 是分离,不是转换 读入时不做任何重编码。原有的音频流被完整地从容器里取出,所以这一步不会损失任何音质。
- 不需要先导出 MP3 老教程让你先抽一个 MP3,是因为当年的工具只收音频文件。这一步现在是多余的,而且重新压成 MP3 只会让声音更差。
- 时间戳来自音频 每一行都带着它被说出的时刻,正是这一点让同一份稿子不用额外加工就能变成 SRT 字幕文件。
- 手上已经是音频了? 如果你的文件是 MP3、WAV 或 M4A 而不是视频,音频那边的工具可以直接处理:同一个引擎、同一份积分,只是少一步。
四步把 MP4 转成文字
整个流程都在浏览器里跑完。不用装任何东西,也不用事先处理文件。
原样上传 MP4
直接从硬盘把文件拖进来。它从浏览器直传到存储,所以大体积录制不会在半路被某个中间的大小限制卡住。
音轨被剥离出来
打开容器,把声音从画面里分出来,只让声音继续往下走。这是自动完成的,不是需要你操作的一步。
跑语音识别
在 100 多种语言里判断出说的是哪一种,结果按时间戳切成段落返回,可以直接读、直接改。
按需要导出
做文档就导纯文本,要把话作为字幕放回视频就导 SRT 或 VTT。跑一次,想拿几种格式都行。
十分钟的 MP4 通常一分钟内就返回。长文件会在内部切分处理再拼回来,所以两小时的文件和两分钟的文件用起来没有区别。
真正需要转文字的那些录制
它们几乎都不是奔着转文字去拍的。这才是常态,不是例外。
会议录像
从会议软件里导出的 MP4。通常是你能拿到的最干净的声音,因为它是从通道里过来的,不是从空气里。
屏幕录制
教程、操作演示、问题复现。系统声音加麦克风,而且长到让你不想再拖着进度条找。
课程与培训
一个人讲一个小时以上 —— 这是可检索的文字稿单个文件省时最多的场景。
手机拍的访谈
用当时兜里那台设备拍的。码率高、文件大,而且人声是从比谁都预想的更远的地方录进去的。
视频版播客
节目已经做完了,节目笔记还没有。有转写稿,第二件事就从「重听一遍」变成「编辑一下」。
活动与会议记录
值得引用的演讲,埋在没人会拖着看完的文件里。让它们可被引用的是文字。
45 分钟的网络研讨会 返回大约 6,000 词,足够撑起一篇文章、一封邮件通讯和几条切片的原料。
2 小时的课程 480p 下大约 200MB,两个上限都留有很大余量。内部切分处理,返回时是一整份稿子。
10 分钟的访谈 1080p60 下轻松到 1.2GB。体积上限还很宽裕,但足以说明分钟和兆字节不是同一把尺子。
30 秒的短片 250 积分。计费跟着录制时长走,所以短文件不管分辨率多高都很便宜。
进去什么,出来什么
MP4 和它的近亲
MOV、AVI、MKV、WebM 的处理方式完全一样 —— 它们也是容器,音轨从每一种里取出来的方式都相同。
TXT 用来读
纯文本,可带可不带时间码。做纪要、检索、引用,或者把内容倒进初稿,选它就对了。
SRT / VTT 用来做字幕
带时间轴的文件,可直接进 YouTube、Premiere、Final Cut 或任意播放器。把 SRT 命名成和 MP4 一样,大多数播放器会自动加载。
100+ 语言
自动识别。中途换语言的录制,也会按每段实际说的语言分别转写。
字幕不会烧进画面里 —— SRT 始终是一个独立文件,所以改个人名或术语,不需要把视频重新导出一遍。
怎样从 MP4 里拿到干净的稿子
MP4 里的声音,几乎总是在还没人想到要转文字的时候就录下了。你没法回去重录,但知道什么会拉低准确率,就知道哪些能补救、哪些只能接受。
- 相机麦克风的距离 手机和相机的麦克风离说话人有好几米,会把整个房间连同人声一起收进去。这是手机拍的 MP4 转写效果不如录屏的首要原因。
- 录屏天生占优 当声音来自系统而不是空气,就没有房间、没有距离、也没有握持噪音。这类文件的结果稳定地最好。
- 背景音乐 垫在对话下面的音乐,对识别的干扰远大于空调这类稳定噪音。请在转写之前去掉,而不是之后。
- 多人同时说话 抢话是段落变糊最常见的原因。事后没有补救办法,这些地方要做好手工整理的准备。
- 专有名词和术语 产品名和技术词,是即便 97% 准确率的稿子也会露馅的地方。在导出的文本上做一遍查找替换,一分钟不到就能搞定。
你的 MP4 到底能有多长?
付费套餐单个文件支持 120 分钟或 2GB,以先到者为准 —— 而你会先撞上哪一个,完全取决于这段视频是怎么录的。决定权在码率,不在时长。下面是按典型码率估算的数字,你的实际文件可能有出入。
| 来源 | 典型码率 | 2GB 能装 | 120 分钟约 | 先撞上的上限 |
|---|---|---|---|---|
| 手机 4K | 45 Mbps | 约 6 分钟 | 约 40GB | 体积 |
| 手机 1080p60 | 25 Mbps | 约 11 分钟 | 约 22GB | 体积 |
| 手机 1080p30 | 17 Mbps | 约 16 分钟 | 约 15GB | 体积 |
| 录屏 1080p | 8 Mbps | 约 33 分钟 | 约 7GB | 体积 |
| 会议导出 720p | 2 Mbps | 约 2.2 小时 | 约 1.8GB | 时长 |
| 课程 480p | 1 Mbps | 约 4.4 小时 | 约 0.9GB | 时长 |
如果文件太大: 上传前用更低的码率重新编码。把手机视频从 1080p60 降到 720p,体积大约缩到十分之一,而转写结果不会有任何变化 —— 因为重编码视频根本不碰音轨。切分文件也可行,只是之后要手工把两份稿子接起来。真正没用的做法是先转成 MP3:同样的音频,多一道工序,还多压缩了一次。
文字能解锁什么
下面这些工具用的都是和转写同一份积分余额 —— 没有一个需要再开一份订阅。