Whisper:本地跑的开源语音转写模型

2026-08-25
Whisper 又称 OpenAI Whisper、语音识别模型、语音转写模型、ASR 模型
分类
音频
平台
Windows、macOS、Linux
许可证
MIT
许可证说明
官方仓库明确代码与模型权重均按 MIT 协议发布,商用无授权费,保留版权声明即可。
是否开源
开源
收费模式
免费
适用工序
播控与内容
选型结论:免费、开源、能本地跑的语音转写模型,适合给展厅讲解视频先出一版转写稿/字幕草稿再人工校对;它是命令行加 Python 库,不是双击就能用的软件,官方明确不支持实时转录,也没有说话人分离能力。
官方下载
版本 20250625 · 发布于 2025-06-26
前往官网下载 ↗

它到底解决什么

Whisper 是 OpenAI 开源的语音识别模型,官方仓库给它的定位是"通用语音识别模型":喂给它一段音频,它能把里面说的话转成文字,还能做多语种识别和把非英语语音直接翻译成英文。它不是一套录制软件,也不是一个播放器插件,纯粹只做一件事——把"声音"变成"文字"。

对展厅项目来说,这件事对应的是一个很具体的痛点:人工听打慢。一部十几分钟的讲解视频,找人一句一句听、一句一句敲,动辄大半天;赶工期的时候这笔时间根本挤不出来。Whisper 干的活是把这大半天压缩到几分钟到几十分钟(视素材长度和本机算力而定),代价是转出来的文字不能直接用,需要过一遍人工校对——这笔账后面会算清楚。

展厅哪道工序会用到它

第一种,展项视频配字幕。 甲方经常要求所有讲解视频、宣传片都带字幕,理由通常有两条:一是无障碍要求,二是展厅现场背景音杂、音响效果一般,观众光看画面听不清楚,字幕能救场。传统做法是安排人听打逐句录入,Whisper 能先出一版转写稿,把"从零开始打字"变成"校对已有文字",工作量差一个量级。字幕文件做完之后要怎么接进播放器,跟本文不是一回事,参见站内《字幕/字符叠加播放实现》

第二种,讲解词整理成文案。 布展期经常有这种情况:讲解词是甲方专家现场口述录下来的,或者是往年讲解员带教时的录音,文字稿从来没人整理过。把这些录音转成文字,就能直接拿去做展板文案、导览手册底稿,或者沉淀成一份知识库,给新讲解员培训用,不用每次都靠老讲解员口口相传。

第三种,多语言字幕的第一道工序。 涉外展厅、双语展馆常要求中英字幕同步。直接找人翻译音频不好操作,通常的路子是先把母语(比如中文讲解)转成文字,再把这份文字稿交给翻译,翻完再对时间轴。Whisper 顶的就是"先转写"这一步,把最耗时的从零听打环节省下来。

怎么获取,该下哪个包

这里要先说清楚一件容易踩坑的事:Whisper 没有安装包,也没有官方发布的双击可运行程序。它是一个 Python 代码库,官方仓库只给了两种获取方式:一是用 Python 的包管理工具执行安装命令拉取已发布的版本,二是直接从代码仓库拉取最新提交自己安装。装完之后,使用方式是在命令行里敲命令,或者在 Python 脚本里调用它的接口,跟"打开一个软件、点几个按钮"完全是两回事。

除了 Python 环境本身,官方明确还要求系统里装好一个叫 ffmpeg 的命令行工具,专门负责把各种格式的音视频文件解码成 Whisper 能读的数据,这是必装项,不装直接报错。另外官方提到,如果所在电脑上没有预编译好的分词器组件,安装过程还可能需要额外装一套 Rust 语言的编译工具链——这一步不是每台机器都会碰到,遇到了官方文档给了具体处置办法。

授权上不用纠结:官方仓库明确代码和模型权重全部按 MIT 协议发布,个人用、商用都不需要额外付费或申请授权,唯一的义务是保留版权声明。这一点比很多"免费闭源"或者"核心免费、高级功能收费"的软件干净得多,报价时不用给客户解释哪部分要额外付费。

给不懂命令行的实施人员的现实建议:官方仓库本身没有图形界面,如果项目组里没有能操作命令行的人,需要找一个经过独立核实的第三方图形界面封装工具来代替直接用命令行操作。这类封装工具市面上确实存在,但本文不点名推荐——每一个都要单独核实来源是否可信、跟没跟得上官方模型更新、许可证是不是干净,不能因为界面好看就默认它靠谱。

最短可用路径

跑通一次最简单的转写,官方给的路径是这样的:

  1. 装好前置环境。 电脑上要有 Python,还要有 ffmpeg 这个命令行工具——Windows、macOS、Linux 各自的包管理器都能装,官方文档给了每种系统对应的安装命令。
  2. 装 Whisper 本体。 在命令行里执行官方给出的安装命令,把 Whisper 拉下来装好。
  3. 跑第一条转写命令。 命令行里对着一个音频文件敲一条命令,指定用哪一档模型。命令跑起来之后会有进度提示,能看到它在一段一段处理。
  4. 看输出文件。 命令跑完,默认会在当前目录下生成好几种格式的文件——纯文本、字幕格式等(下一节详细说)。打开这些文件、文字基本对得上录音内容,就算这次操作成功了。

如果音频不是英语,官方建议显式指定语言,识别准确率会比让模型自己猜语言更稳。如果要把非英语讲解直接翻译成英文文本,命令里有专门的参数控制,但要注意官方特别提醒:并不是所有档位的模型都支持翻译任务,选错档位翻译功能不生效,选型时要按官方文档核对清楚。

展厅工程里真正要弄明白的那几件事

它是模型不是软件,这一点必须先讲清楚

前面已经反复提过,这里再强调一遍,因为这是实施人员最容易踩的坑:Whisper 官方发布的是命令行工具和 Python 代码库,不是可以直接双击运行的桌面程序。装的过程要用到命令行、要装 Python 环境、要装 ffmpeg,这一整套对没写过代码的人来说门槛不低。如果指望"下载一个 exe 装上就能用",装到一半就会卡住,白白浪费工期。项目排期时要把"谁来装、谁来跑命令"这件事提前定好,要么找懂命令行的人负责,要么提前选好并核实一个可靠的图形界面封装方案,不要等到交付前一天才发现没人会用。

本地跑与云端服务,选哪个是合规问题不是技术问题

语音转文字这件事,市面上还有很多按云端接口调用的付费服务,把录音文件传上去、服务器处理完把文字传回来。这类方案通常好用、免维护,但代价是你的音频素材必须离开本机、经过对方的服务器

Whisper 的价值恰好卡在这条线上:装在本地机器上跑,从头到尾音频文件不出这台机器、不联网。对涉密展馆、政务展厅、企业内部只能内网作业的项目,这不是锦上添花的加分项,而是能不能过甲方安全审查的硬门槛。谈方案时,"素材是否出网"这一句话往往比转写准确率高不高更能决定选型。反过来,如果项目对数据出不出网完全无所谓、又图省事,云端方案未必比自己搭一套本地环境麻烦——这笔账要按项目实际情况算,不是无脑选本地就一定对。

硬件怎么判断,别死记配置数字

Whisper 提供从小到大好几档模型可选,官方仓库里有一张对照表(见出处),列出每一档大致需要多少显存、跑起来相对快慢。这张表上的具体数字会随官方后续调整模型而变化,本文不逐档抄一遍,但背后的判断方法是稳定的:档位越大,转写越准,但越吃显存、跑得越慢;档位越小,跑得越快、对硬件要求越低,但碰到口音重、专业术语多的场景更容易出错。

给实施和售前的现场判断法:

  • 先别急着奔着最大档位去配显卡。拿项目里真实的讲解音频,用一个中等偏小的档位实际跑一遍,看输出结果够不够用;不够用再往上加一档,逐级试,而不是一上来就按最高配置报价。
  • 机器上没有独立显卡也不是完全跑不了,只是会更慢——用较小的档位配合普通处理器,同样能出结果,只是等待时间要长一些,适合对时效要求不高的批量转写任务(比如晚上跑一批素材,第二天来看结果)。
  • 素材量大、要求出结果快的项目,才需要认真考虑配一张独立显卡;零星几段视频偶尔转写一次,用普通办公电脑跑一跑完全够用,不必为这一个工具单独添置硬件。

中文效果与后期校对,不能承诺"全自动"

官方模型卡自己写得很直白:这个模型是在大规模、弱标注的网络音频数据上训练出来的,预测结果里可能包含音频里根本没说过的文字,官方管这个现象叫"幻觉"。换句话说,转写稿不是校对完成品,是校对的起点。展厅场景尤其要盯紧几类高发错误:展项名称、人名、专有技术词汇——这些词通用模型没见过对应的上下文,容易按同音字瞎猜,必须逐字核对,不能因为大段文字看着通顺就直接采信。

官方模型卡还提到一点跟展厅场景相关:模型在不同语言上的表现并不均匀,训练数据里各语种占比不一样,样本少的语种识别效果会打折扣。具体到某一种语言、某一种口音表现如何,官方建议使用前先在自己实际会用到的素材上做评估,而不是假设一定好用。这条判断法比记住一个笼统的"中文准不准"的结论更靠谱——同样是中文,播音腔的讲解词和带方言口音的现场采访,效果可能完全不是一个水平。

字幕时间轴这块也要提前打个预防针:官方给出的默认时间戳是按音频切成的段落级别,不是逐字精确对齐;要更精细的逐词时间戳,官方标注这项功能目前还是"实验性",默认是关闭的。也就是说,转写稿的时间轴多半还需要人工再调一遍才能严丝合缝地对上画面,别指望一步到位。

产出格式,能不能直接出字幕文件

这一条已经据实核实:Whisper 命令行工具支持直接指定输出格式,可选纯文本、两种主流字幕格式、表格式文本,以及两种结构化数据格式,默认情况下会把所有格式都生成一遍,放在指定的输出目录里。也就是说,转写完成后不需要再找别的工具转换,字幕格式的文件是直接产出的,可以直接送进播放器或视频剪辑软件里试着挂载,看时间轴和内容对不对,再决定要不要人工微调。

踩坑与排错清单

现象 原因 处置
安装过程中报错,提示缺少编译工具 当前系统没有预编译好的分词器组件,需要额外的编译环境 按官方文档说明装好对应的编译工具链,再重新安装
命令跑起来直接报错,提示找不到音视频解码工具 系统里没装 ffmpeg,这是运行的必备前置项 用对应系统的包管理器装好 ffmpeg 后重试
转写结果里出现录音里根本没说过的句子 官方承认的"幻觉"现象,模型在噪音、静音或含糊片段容易编造文字 必须人工校对,不能直接采用;静音段落多的素材尤其要重点复核
展项名、人名、专业术语被转写成同音字 通用模型没见过这些专有名词的上下文,只能按发音猜测 校对时逐条核对专有名词,建立一份本项目的专名对照表反复核查
字幕时间轴和画面对不太上 默认时间戳是按段落切分,不是逐字精确对齐,逐词对齐功能官方标注为实验性且默认关闭 需要精细对时间轴时按官方文档打开对应选项,出来的结果仍需人工微调
处理某个档位模型时报错或者卡死不动,长时间没反应 这台机器的显存或内存不够这一档模型的需求 换小一档模型,或改用不依赖独立显卡的方式跑,牺牲速度换成功率
跑非英语音频,翻译成英文这个选项没反应 官方明确并不是所有档位都支持翻译任务,某些档位只做同语言转写 按官方文档核对当前档位是否支持翻译,需要翻译功能就换到支持的档位
想知道多人对话录音里每句话是谁说的,结果没有任何区分 官方模型卡明确说明说话人分类、分离这类能力没有经过官方评估,模型本身不提供 不要指望它自动区分说话人,多人对话录音的说话人标注仍需人工完成,或另外配合专门的说话人分离方案

什么时候别用它

需要现场实时滚动字幕的场合,别用它。 官方模型卡明确写着这套模型不是为开箱即用的实时转录设计的。展厅里如果要求讲解员说话的同时字幕同步滚动显示,这不是 Whisper 能力范围内的事,得找专门做实时语音识别的方案。

多人对话、访谈类录音要分清楚谁在说话时,别指望它。 前面反复强调过,说话人分离官方没有评估、模型本身不提供这项能力,硬用它去猜谁说了哪句话,结果不可靠。

要求达到出版物级准确率、不能留校对工时的场合,别把它当终稿工具。 官方自己承认存在"幻觉"现象,转写稿必须经过人工校对才能对外发布,项目排期里一定要给这道校对工序留出时间,不能压缩成零。

现场没人会操作命令行、又找不到可靠图形界面封装的场合,先别急着上。 装环境、跑命令这套流程对纯运维、售前背景的同事门槛不低,硬着头皮上容易在装环境这一步就卡住工期,不如提前规划好谁来负责这部分操作。

与本站的衔接

  • 转写出来的字幕文件要怎么接进播放器、外挂字幕和硬字幕怎么选,参见 《字幕/字符叠加播放实现》
  • 展厅多媒体内容制作从脚本到成片的完整流程,包括字幕、翻译这类环节该在哪个阶段介入、怎么跟甲方谈验收节点,参见展厅方案库

音频故障不会有人投诉,只会有人走开

观众不会说「这个展项没声音」,他们只是走开。而音频设备恰恰是展厅里最不起眼、最少被巡检的一类,等甲方发现时可能已经这样好几天了。

企服君把音频设备的在线状态纳入统一巡检,异常时主动告警。集成商如果经常交付带音频分区的展厅,见集成商年费方案

出处

本文所述的能力边界与限制均来自上述官方材料;文中涉及的展厅工序判断属于工程经验,具体项目请以现场素材实测效果和官方最新文档为准。

📄 来源 / 自校链接

本文为公开资料整理,非亲测。关键参数与代码请结合实物与下列官方来源验证。

做展厅项目,软件授权不必每次重走采购

企服君有九款自研展厅软件。集成商年费一次备好全年额度,接到项目直接激活;已激活项目的授权永久有效。

留言讨论

评论发布后会被人工复核,违规内容将被删除。

    还没有人评论,来说说你的看法

    如果发表没有反应,可以前往联系我们告诉我们。

    这个页面有问题?

    提交时会附带当前页面地址和浏览器信息,帮助我们定位问题。不填联系方式即为匿名。