WAV 转写

WAV 转文字, 顺便把体积讲清楚

直接从 .wav 文件把 WAV 转成文字,不需要先做格式转换。WAV 是未压缩的,这让它成为唯一一种通常先卡住你的是体积而不是时长的音频格式 —— 这一页会在你开始上传之前告诉你那条线在哪。

无损进,文字出 单个 WAV 约 99 分钟 TXT / SRT / VTT

把 WAV 文件拖到这里

WAV、MP3、M4A、FLAC、OGG、WebM

自动识别语言
TXT · SRT · VTT
时间戳说话人切换
转写我的 WAV
为什么是 WAV

.wav 文件从哪来,以及这个格式为什么还活着

当一台设备决定不替你做选择时,你拿到的就是 WAV。Windows 录音机、Audacity、手持录音笔、会议室设备,以及几乎所有专业声卡,默认写出的都是 WAV —— 因为它把麦克风听到的东西原样保存下来,一点没扔。

这个格式诞生于 1991 年,熬过了几乎所有同期出现的对手。没有专利、没有授权、没有会选错的变体 —— 有史以来写过的任何音频软件都能打开一个 .wav 文件。录音棚和档案馆至今仍以它为标准,靠的就是这份可靠。

这也意味着 WAV 文件极其庞大。CD 品质的未压缩音频约为每分钟 10MB,大约是同等 MP3 的十倍,而这一个事实决定了本页后面几乎所有内容。

什么都没被丢掉

WAV 保存的是原始 PCM 采样。没有任何心理声学模型替你判断哪部分声音你不会想念,因为压根就没有发生过压缩。

体积是十倍

CD 品质下每分钟约 10MB。一小时的访谈接近 620MB —— 到上传那一步,这个体积就开始要紧了。

到哪都读得开

不用装编解码器、不用授权、没有变体。这就是三十年后录音设备和归档系统仍然默认用它的原因。

体积先于时长

在其他任何音频格式上,先起作用的都是时长上限。在 WAV 上,先到的是文件体积 —— 下面那张表就是为此准备的。

定义

把 WAV 转成文字,实际做的是什么

把 WAV 转成文字,是指直接对文件里未压缩的 PCM 音频运行语音识别。事前不做任何转换:识别器按采样原样读取,然后把说出的话作为带时间戳的文本返回。

关于把 WAV 转成文字,有四件事值得在第一次上传前知道,其中一件与大多数人的假设相反。

  • 不需要格式转换 你不用先把 .wav 变成 MP3。在转写之前转成有损格式,只会移走识别器本可以用上的信息。
  • 无损带来的帮助比你以为的小 同一段录音的 128kbps MP3 和未压缩 WAV,差距很小。真正拉动准确率的是麦克风距离和背景噪音,其影响远大于文件格式。
  • 识别反正是在 16kHz 上跑的 语音模型内部大致工作在 16kHz 单声道。96kHz/24bit 的母带在识别开始之前就会被降采样,多出来的数据只是让你的上传变慢。
  • 时间戳来自音频 每一行都带着它被说出的时刻。正因如此,WAV 的转写稿也能导出成 SRT —— 等这段音频日后配上画面时就用得着。
使用方法

四步把 WAV 转成文字

全部在浏览器里完成。不用装任何东西,开始之前也没有转换步骤。

1

原样上传 .wav

把文件直接拖进来。它从浏览器直传到存储 —— 这一点在 WAV 上比在别的格式上更要紧,因为 WAV 文件大到只要中间有个体积限制,大多数都会被拦下。

2

音频被直接读取

PCM 采样不经中间编码就送进识别器。一路上不做删减、不降质、也不重新压缩。

3

跑语音识别

在 100 多种语言里判断出说的是哪一种,结果按时间戳切成段落返回,可以直接读、直接改。

4

按需要导出

做文档和纪要就用纯文本;如果这段录音之后要配上画面,就导 SRT 或 VTT。

十分钟的 WAV 通常一分钟内返回。对多数文件来说,上传花的时间比转写还长 —— 单纯因为要搬的兆字节更多。

值得知道如果你的 WAV 已经接近体积上限,请在上传前转成 FLAC 而不是 MP3。FLAC 同样是无损的 —— 它只是把同样的采样存得更省,体积约为一半。
值得知道如果你正打算录一段专门用来转写的素材:识别器用到的只有 16kHz 单声道。耳朵听着单薄,但转写结果一模一样,体积却只是零头。
WAV 出现在哪

那些以 .wav 形式送到手上的录音

它们有个共同点:格式是设备选的,而设备选择了保真而不是省事。

手持录音笔

记者和研究者用 WAV 录音,因为那是设备信任的格式。一小时的访谈拿到手约 600MB。

Audacity 工程

默认导出为 WAV。往往已经做过降噪整理,因此属于比较好转写的一类文件。

会议室系统

固定安装的音频设备写的是未压缩格式。声音通常很好 —— 吊顶麦克风到现在也还是胜过桌子对面那台手机。

法务与医疗口述

这类场景常按规定要求未压缩,因为压缩本身就是一种改动。同时这里对准确率的要求也最高。

播客母带

剪辑成品留作 WAV,MP3 只为发布而生成。转写母带,就省掉了一代损失。

档案与口述历史

为长期保存,馆藏统一采用 WAV。而让几十年的磁带终于可被检索的,是文字。

30 分钟访谈 CD 品质下约 310MB。上传和转写都没问题,花费 15,000 积分。

90 分钟课程 约 930MB —— 已经足够接近 1GB 上限,值得先转成 FLAC 再传。

2 小时录音 约 1.2GB,超出上限。转成 FLAC 或单声道之后,同样的音频就能轻松装下。

5 分钟语音备忘 约 52MB。稳稳落在免费额度内 —— 免费额度约合九分半钟的未压缩音频。

输入与输出

进去什么,出来什么

WAV 和其他音频

MP3、M4A、FLAC、OGG、WebM 的处理方式相同。值得记住的是 FLAC:和 WAV 一样无损,体积却只有约一半。

TXT 用来读

纯文本,可带可不带时间码。多数 WAV 转写稿最终就变成这个:纪要、引用、可检索的记录。

SRT 与 VTT

带时间轴的文件。即便是纯音频录音,只要素材之后要配画面或者带播放器发布,它们仍然有用。

100+ 语言

自动识别。中途换语言的录音,会按每段实际说的语言分别转写。

不会有任何东西被写回你的 WAV 文件 —— 转写稿是一份独立文档,你的原始录音保持不动。

准确率

真正决定 WAV 转写质量的是什么

「未压缩音频转写起来明显更准」是一个流传很广的假设,它塑造了大家面对 WAV 转文字时的思路。但事实并非如此,而知道为什么,能让你不去优化错的地方。

  • 无损不是那个杠杆 同一段录音的 128kbps MP3 和未压缩 WAV,转写结果几乎一致。压缩丢掉的是高于人声所占频段的部分,而识别器本来就没在用它们。
  • 麦克风距离才是 两米外的录音笔会把房间连同人声一起录下来,而房间糊掉的东西,再高的位深也救不回来。单这一个因素的分量,就超过整个格式之争。
  • 采样率几乎不影响 识别大致在 16kHz 上运行。高于此的部分在模型看到之前就被丢弃了,所以 96kHz 相对 44.1kHz 没有任何收益。
  • 削波无法撤销 如果录音电平推得太高、波形顶部被削平,那些词就是没了。未压缩只意味着这份失真被忠实地保存了下来。
  • 背景音乐照样有害 垫在人声下面的音乐对识别的干扰大于稳定噪音。请在转写之前去掉 —— 是不是无损,在这件事上没有任何区别。
文件体积

在体积上限拦住之前,WAV 能有多长

这是 WAV 转文字唯一一处与其他所有音频格式表现不同的地方。付费套餐允许单个文件 120 分钟或 1GB —— 而由于未压缩音频实在太大,WAV 是唯一一个先耗尽这 1GB 的格式。约 99 分钟,而不是 120 分钟。除特别标注外,以下数字均为立体声。

格式与规格码率每分钟1GB 能装该怎么做
WAV 44.1kHz 16bit(CD)1,411 kbps10.3 MB约 99 分钟90 分钟以内没问题
WAV 48kHz 24bit(录音棚)2,304 kbps16.9 MB约 60 分钟上传前必须转换
WAV 44.1kHz 16bit 单声道706 kbps5.2 MB约 198 分钟讲话录音绰绰有余
WAV 16kHz 16bit 单声道256 kbps1.9 MB约 9 小时识别实际用的规格
FLAC(无损压缩)约 700 kbps约 5 MB约 200 分钟两头都占
MP3 128kbps128 kbps0.9 MB约 18 小时有损但绰绰有余

实际结论: 如果你的 WAV 超过约 90 分钟,请在上传前转成 FLAC。FLAC 是无损的 —— 采样会逐比特原样还原 —— 但存储只占约一半空间,这一下就把上限从 99 分钟推到三小时以上。转成单声道能再减半,而且对讲话录音没有任何代价,因为识别本来就会把声道合并。真正不值得做的是出于谨慎转成 MP3:它确实装得下,但你是在为一个你本来就已经越过的上限丢弃数据。

常见问题

关于 WAV 转写的问题

免费把你的第一个 WAV 转成文字

每个新账号都包含约十分钟的转写额度 —— 换算成未压缩音频,大约是一个 100MB 的文件。足够跑一段真实录音,用自己的素材看效果。

转写一个 WAV 文件