视频转文字

几秒钟把任意视频转成准确、带时间戳的文字 —— 可直接阅读、检索,或导出为字幕。

100+ Languages
MP4 / MOV / AVI / MKV
TXT / SRT / VTT
10 Min Free
示例视频(会议演讲)中的一帧画面0:26

[示例]会议演讲,1080p 录屏

00:00:03大家最先问的问题都是:时间到底花到哪儿去了?

00:00:11我们量过。大约四成花在了没有人会看见的工作上。

00:00:19而这部分,恰恰是你在加人之前就能自动化掉的。

00:01

为什么要把视频里的话变成文字

信息都在视频里,也困在视频里

录下来的工作坊、客户访谈、两小时的战略会。团队最有价值的思考,越来越多发生在镜头前而不是纸上。

但视频文件是不透明的。你没法检索它、引用它、快速扫一遍,也没法把其中一句粘进文档。里面说过的每句话都锁在播放这一层后面,而播放只有一种速度:实时。

插图:对话气泡与声波被封在视频文件里,旁边的文档和放大镜够不到

不转写视频的三笔账

这三笔账容易被忽略,因为它们都不会出现在费用清单上。它们体现为一些悄无声息、始终没做成的事。

损失搜索流量

搜索引擎收录的是文字,不是声波。一段没有转写稿的一小时视频,等于一小时没人能搜到的专业内容。

损失可访问性

听障用户、外放不方便的用户、用第二语言观看的用户,都需要文字。没有文字,他们只会直接离开。

损失复用价值

一次录制里藏着一篇文章、一封邮件通讯和十来条社交切片。可只要「把话取出来」还是件手工活,这些就都不会做。

专业人工转写从每分钟 2 美元起 —— 一段两小时的录音要 240 美元。这个价格下结论是自明的:绝大多数录制根本不会被转写。AI 转写把这笔账压到每分钟几美分,「把所有素材都转一遍」这个选项才第一次变得现实。

00:02

什么是视频转文字工具

视频转文字工具是把视频文件中的音轨单独提取出来,再用语音识别把口语转成文字的工具,通常会带上时间戳,让每一行都能对应回视频里的那一刻。

AI 视频转写实际是怎么跑的

从你丢进文件到拿回文字,中间发生了三件事。了解这三件事,基本就能解释清楚结果质量由什么决定。

第一步 —— 提取音轨

视频文件其实是画面和声音两条流打包在一起。这里只用得上声音,所以画面轨会被最先丢掉。这也是视频转文字和音频同价的原因:在转写开始之前,画面就已经不在了。

第二步 —— 语音识别

音频送进一个把声音映射成词的模型。如今的模型处理口音、抢话和多语言混说,比十年前的语音输入强太多;不过原始录音干净,永远是最有效的条件。

第三步 —— 标点、时间戳与说话人切换

识别刚出来时是一串不断句的词。最后一道处理补上句子边界和大小写,并加上时间码,让每一行都能指回它被说出的时刻。

示意图:视频文件分离成画面轨和音频轨,音频轨再变成文字

转写稿、字幕、无障碍字幕不是一回事

这三个词经常被混用,但不该混。你需要哪一种,直接决定该导出什么格式。

转写稿

把说过的话完整整理成可阅读的文档。适合检索、引用、做纪要,或改写成文章。

字幕

同样的内容切成短行、按时间点显示在画面上。以 SRT 或 VTT 交付,默认观众听得见声音。

无障碍字幕

在字幕之外补上非语言信息:笑声、音乐、关门声。很多场合下,真正满足无障碍要求靠的是这一种。

00:03

三步把视频转成文字

整个流程都在浏览器里完成,不用装任何东西,也不需要你先把音频抽出来。

三步流程:上传视频、AI 转写、导出文字

第一步 —— 上传视频文件

把文件拖进上传区,或者从硬盘选一个。文件从浏览器直接传到存储,所以大体积录制不会卡在中间的大小限制上,上传过程中也有进度条可看。

支持的格式

MP4、MOV、AVI、MKV 和 WebM,基本覆盖了相机、手机和录屏软件的所有输出。不需要先导出 MP3 再转写这种两道工序 —— 音轨会自动提取。

大小与时长限制

每个文件最长 120 分钟,付费版单个视频最大 2GB。作个参照,2GB 大约是半小时 1080p 素材,或者完整两小时的 480p。免费账号支持 10 分钟以内的文件。

第二步 —— 交给 AI 转写

上传一完成就开始处理。十分钟的视频通常一分钟内返回;长录制会在内部切分处理再拼回来,所以两小时的文件和两分钟的文件用起来没有区别。

关于语言选择

说话的语言会在 100 多种语言里自动识别,基本不需要你去设置。中途换语言的录制,也会按每一段实际说的语言分别转写。

怎样拿到更准的转写稿

识别质量取决于录音本身,而不是转写工具。能直接发布的稿子和必须重写的稿子,差别基本可以用下面四点解释。

录人声,不要录房间

贴近说话人的领夹麦或头戴麦,胜过摆在桌子对面的贵麦克风。距离正是让房间混响和环境噪音混进来的原因,而一旦录进去,再好的模型也不如「一开始就没录进去」干净。

尽量别抢话

两个人同时说话,是结果糊掉最常见的原因。录访谈或圆桌时,每次回答前停顿一下,不花任何成本,效果提升却是肉眼可见的。

先去掉背景音乐

垫在对话下面的音乐,对识别的干扰远大于空调这类稳定噪音。素材里有配乐的话,请在转写之前去掉,而不是之后。

专有名词和术语要预留修改

产品名、公司名和专业术语,是即便 97% 准确率的稿子也会露馅的地方。在导出的文本上做一遍查找替换,一分钟不到就能处理完,而且值得赶在做成字幕之前处理掉。

第三步 —— 检查并导出

转写结果会按时间戳切成段落呈现,可以直接读和改。所有导出格式都基于同一份结果,所以一次转写可以拿走不止一种格式。

导出 TXT 做文档

纯文本,可带可不带时间码。用来做纪要、检索、引用,或者把内容倒进初稿,选它就对了。

导出 SRT / VTT 做字幕

带时间轴的字幕文件,可直接导入 YouTube、Premiere、Final Cut 或任意播放器。把 SRT 和视频一起上传,字幕无需再编辑就能显示。

00:04

转成文字之后能做什么

转写稿本身很少是真正的目的。它是让另外四件事变便宜的那一步,价值大头也在后面。

一条视频变五份素材

话一旦以文字形式存在,这段录制就不再是一个交付物,而是原材料。

把网络研讨会变成文章

45 分钟研讨会的转写稿就是一份 3000 词的初稿。删改一份初稿,比对着空白页写新文章快得多。

整理节目笔记

把时间戳、提到的链接和三句最好的原话挑出来即可。二十分钟搞定,不用重听一遍。

从长视频里切社交短片

扫一遍文字找出值得剪的片段,再用时间码在剪辑软件里瞬间定位。

示意图:一条视频分支出文章、节目笔记、社交切片、字幕和配音版本

加上字幕,面向海外观众

导出 SRT,你的视频就成了关掉声音也能看的内容 —— 而社交平台上相当大比例的视频本来就是这么被看的。在会收录字幕文件的平台上,内容也因此能被搜到。

把视频配成 16 种语言

字幕让人用另一种语言「读」你的视频,配音则让人「听」,而且保留原说话人的声线。因为所有功能共用同一份积分余额,你刚才为转写付过的钱不用再付第二遍。

试试 AI 配音 →

噪音大的素材先清理

如果录音里有车流声、空调声,或者人声下面压着音乐,那么在转写开始之前,准确率就已经被拖低了。先把噪音去掉,通常是性价比最高的一次质量提升。

试试人声分离 →

00:05

视频转文字的价格 —— 实际要花多少

转写按素材时长计费,从同一份积分余额里扣。没有按人头收费,没有单独的转写订阅,同一份结果导出多种格式也不额外收钱。

一分钟视频转写的成本

每分钟 500 积分,与分辨率和文件大小无关 —— 计费看的是录制的「时长」而不是「体积」。同样长度的 4K 录屏和手机片段,价格完全一样。

套餐价格积分可转写时长每分钟
免费版$05,000(一次性)约 10 分钟免费
Basic$9.99/月50,000约 1.6 小时$0.100
Standard$19.90/月100,000约 3.3 小时$0.100
Professional$49.90/月350,000约 11.6 小时$0.071
Premium$99.00/月800,000约 26.6 小时$0.062
Max$199.00/月2,000,000约 66.6 小时$0.050

所有套餐的转写单价都是每分钟 500 积分;高档套餐折合单价更低,是因为它们包含的积分增幅高于价格增幅。按年付费再减 20%。

同一份积分,所有工具都能用

积分不按功能划分。付转写的那份余额,同样可以用来把这条视频配成另一种语言、给稿子配旁白、清理噪音,或者生成一期播客。转写多、配音少的月份,和反过来的月份,花的钱完全一样 —— 不存在「困在某个用不上的额度里白白过期」的部分。

可以做什么费率50,000 积分能做多少
视频与音频转写500 积分 / 分钟约 1.6 小时素材
AI 配音(16 种语言)12,000 积分 / 分钟约 4 分钟配音视频
人声分离与降噪按任务计转写前先跑一遍可提升准确率
文字转语音配音按字符计把改好的稿子再变回音频

先免费转 10 分钟

新账号自带 5,000 积分,大约十分钟转写量 —— 足够拿一个真实文件跑一遍,用自己的素材而不是演示片段来判断效果。不需要绑卡,这份积分在站内其他工具上同样可用。

00:06

视频转文字工具与人工转写的对比

手动把录音敲成文字仍然是一个选项,而且在少数场景下依然是对的选项。值得说清楚具体是哪些场景。

AI 转写

等待以分钟计,每分钟约 0.05–0.10 美元,干净的单人录音准确率在 95% 以上。积压一百条录制也能照跑,不需要额外安排。

人工转写

等待以小时到天计,每分钟约 2 美元,即便音频困难也能做到接近完美。按文件计费,所以积压越多、成本成比例增加。

插图:从视频到文字的一条短自动路径,与一条又长又绕的人工路径形成对照

速度

熟练的人也要花大约四小时才能处理一小时音频。同一个文件交给转写工具,几分钟就回来了。这个差别决定的是「把它转了」还是「算了不值当」。

成本

每分钟 2 美元对 0.05–0.10 美元,人工要贵二十到四十倍。单独一次访谈,这个差价还扛得住;换成一整季节目,它直接决定这件事做不做得成。

什么时候人工仍然更好

对准确率的要求并不是齐平的,假装它齐平对谁都没好处。确实有些素材需要人来做。

庭审记录、医疗口述、浓重的地方口音,以及多人同时抢话的录音,这些场景里人工转写依然胜过任何模型。一个务实的折中办法是:先跑 AI,再让人校对。改一份 95% 的初稿,比从零敲快得多。

00:07

常见问题