MP4 转写

MP4 转文字, 不用绕道 MP3

把 MP4 丢进来,取出里面的话。音轨会自动从容器里剥出来,中间不需要导出 MP3 这一步,也不会因为二次压缩掉音质。

自动提取音轨 单个文件最大 2GB TXT / SRT / VTT

把 MP4 拖到这里

MP4、MOV、AVI、MKV、WebM — 最长 120 分钟

自动识别语言
TXT · SRT · VTT
时间戳说话人切换
转写我的 MP4
为什么是 MP4

你手上剩下的,几乎总是一个 MP4

手机、录屏软件、会议工具、微单相机 —— 让几乎任何设备拍段视频,落到硬盘上的都是 MP4。它能占住这个位置,是因为它是那个到哪儿都能播、谁都不用多想的容器。

而这份普及,也正是这么多人早晚要把 MP4 转成文字的原因。那段录制从来不是为了转成文字才拍的,它只是记录当时那一刻的设备的默认输出。

所以在把 MP4 转成文字之前,有件事值得先弄明白:MP4 是容器,不是编码。里面装着两条互相独立的流 —— 画面通常是 H.264 或 H.265,声音通常是 AAC。下面所有的事,都是从这一点推出来的。

95% 的体积是画面

在一个典型的 MP4 里,视频流的体积把音频流压得几乎看不见。而你想从转写里拿到的一切,全在那承载声音的几个百分点中。

只有音频会被读

视频流在识别开始之前就被丢掉了。同样长度的 4K 文件和 480p 文件,会给出同样的稿子、同样的价格。

格式很少是你选的

MP4 是设备直接给你的。这也意味着里面的声音是为「看」而录的,不是为「读」而录的 —— 准确率的高低就从这里来。

真正的限制是体积

先卡住你的很少是分钟数。手机拍的视频,会在离时长上限还很远的时候就撞上体积上限。

定义

把 MP4 转成文字,实际做的是什么

把 MP4 转成文字,是指把文件解复用 —— 将其中的音频流与视频流分离 —— 然后只对音频做语音识别。画面在转写开始之前就被丢弃,所以分辨率既不影响价格,也不影响结果。

从这个定义能推出四件事,合起来基本能回答大家在上传第一个文件之前会问的绝大多数问题。

  • 是分离,不是转换 读入时不做任何重编码。原有的音频流被完整地从容器里取出,所以这一步不会损失任何音质。
  • 不需要先导出 MP3 老教程让你先抽一个 MP3,是因为当年的工具只收音频文件。这一步现在是多余的,而且重新压成 MP3 只会让声音更差。
  • 时间戳来自音频 每一行都带着它被说出的时刻,正是这一点让同一份稿子不用额外加工就能变成 SRT 字幕文件。
  • 手上已经是音频了? 如果你的文件是 MP3、WAV 或 M4A 而不是视频,音频那边的工具可以直接处理:同一个引擎、同一份积分,只是少一步。
使用方法

四步把 MP4 转成文字

整个流程都在浏览器里跑完。不用装任何东西,也不用事先处理文件。

1

原样上传 MP4

直接从硬盘把文件拖进来。它从浏览器直传到存储,所以大体积录制不会在半路被某个中间的大小限制卡住。

2

音轨被剥离出来

打开容器,把声音从画面里分出来,只让声音继续往下走。这是自动完成的,不是需要你操作的一步。

3

跑语音识别

在 100 多种语言里判断出说的是哪一种,结果按时间戳切成段落返回,可以直接读、直接改。

4

按需要导出

做文档就导纯文本,要把话作为字幕放回视频就导 SRT 或 VTT。跑一次,想拿几种格式都行。

十分钟的 MP4 通常一分钟内就返回。长文件会在内部切分处理再拼回来,所以两小时的文件和两分钟的文件用起来没有区别。

值得知道传 4K 相比传 1080p 没有任何好处 —— 反正画面都会被丢掉。所以如果快到体积上限了,请在上传之前用更低的码率重新编码,而不是上传之后。
值得知道如果这个 MP4 后面还要配字幕,就在同一次里把 SRT 一起导出。过后再回来,等于把转写费付两遍。
MP4 都从哪来

真正需要转文字的那些录制

它们几乎都不是奔着转文字去拍的。这才是常态,不是例外。

会议录像

从会议软件里导出的 MP4。通常是你能拿到的最干净的声音,因为它是从通道里过来的,不是从空气里。

屏幕录制

教程、操作演示、问题复现。系统声音加麦克风,而且长到让你不想再拖着进度条找。

课程与培训

一个人讲一个小时以上 —— 这是可检索的文字稿单个文件省时最多的场景。

手机拍的访谈

用当时兜里那台设备拍的。码率高、文件大,而且人声是从比谁都预想的更远的地方录进去的。

视频版播客

节目已经做完了,节目笔记还没有。有转写稿,第二件事就从「重听一遍」变成「编辑一下」。

活动与会议记录

值得引用的演讲,埋在没人会拖着看完的文件里。让它们可被引用的是文字。

45 分钟的网络研讨会 返回大约 6,000 词,足够撑起一篇文章、一封邮件通讯和几条切片的原料。

2 小时的课程 480p 下大约 200MB,两个上限都留有很大余量。内部切分处理,返回时是一整份稿子。

10 分钟的访谈 1080p60 下轻松到 1.2GB。体积上限还很宽裕,但足以说明分钟和兆字节不是同一把尺子。

30 秒的短片 250 积分。计费跟着录制时长走,所以短文件不管分辨率多高都很便宜。

输入与输出

进去什么,出来什么

MP4 和它的近亲

MOV、AVI、MKV、WebM 的处理方式完全一样 —— 它们也是容器,音轨从每一种里取出来的方式都相同。

TXT 用来读

纯文本,可带可不带时间码。做纪要、检索、引用,或者把内容倒进初稿,选它就对了。

SRT / VTT 用来做字幕

带时间轴的文件,可直接进 YouTube、Premiere、Final Cut 或任意播放器。把 SRT 命名成和 MP4 一样,大多数播放器会自动加载。

100+ 语言

自动识别。中途换语言的录制,也会按每段实际说的语言分别转写。

字幕不会烧进画面里 —— SRT 始终是一个独立文件,所以改个人名或术语,不需要把视频重新导出一遍。

准确率

怎样从 MP4 里拿到干净的稿子

MP4 里的声音,几乎总是在还没人想到要转文字的时候就录下了。你没法回去重录,但知道什么会拉低准确率,就知道哪些能补救、哪些只能接受。

  • 相机麦克风的距离 手机和相机的麦克风离说话人有好几米,会把整个房间连同人声一起收进去。这是手机拍的 MP4 转写效果不如录屏的首要原因。
  • 录屏天生占优 当声音来自系统而不是空气,就没有房间、没有距离、也没有握持噪音。这类文件的结果稳定地最好。
  • 背景音乐 垫在对话下面的音乐,对识别的干扰远大于空调这类稳定噪音。请在转写之前去掉,而不是之后。
  • 多人同时说话 抢话是段落变糊最常见的原因。事后没有补救办法,这些地方要做好手工整理的准备。
  • 专有名词和术语 产品名和技术词,是即便 97% 准确率的稿子也会露馅的地方。在导出的文本上做一遍查找替换,一分钟不到就能搞定。
文件体积

你的 MP4 到底能有多长?

付费套餐单个文件支持 120 分钟或 2GB,以先到者为准 —— 而你会先撞上哪一个,完全取决于这段视频是怎么录的。决定权在码率,不在时长。下面是按典型码率估算的数字,你的实际文件可能有出入。

来源典型码率2GB 能装120 分钟约先撞上的上限
手机 4K45 Mbps约 6 分钟约 40GB体积
手机 1080p6025 Mbps约 11 分钟约 22GB体积
手机 1080p3017 Mbps约 16 分钟约 15GB体积
录屏 1080p8 Mbps约 33 分钟约 7GB体积
会议导出 720p2 Mbps约 2.2 小时约 1.8GB时长
课程 480p1 Mbps约 4.4 小时约 0.9GB时长

如果文件太大: 上传前用更低的码率重新编码。把手机视频从 1080p60 降到 720p,体积大约缩到十分之一,而转写结果不会有任何变化 —— 因为重编码视频根本不碰音轨。切分文件也可行,只是之后要手工把两份稿子接起来。真正没用的做法是先转成 MP3:同样的音频,多一道工序,还多压缩了一次。

常见问题

关于 MP4 转写的问题

免费把你的第一个 MP4 转成文字

每个新账号都包含约十分钟的转写额度。足够跑一段真实录制,用自己的素材而不是演示片段来判断效果。

把 MP4 转成文字