跳到主要内容

Whisper Desktop官方版 v1.11.0.0

大小 460KB
版本 1.11.0.0
语言 英文
分类 网络软件
软件介绍

Whisper Desktop是一款基于OpenAI Whisper模型的本地语音转文字工具,支持将音频和视频文件中的语音内容转录为文本,全部处理过程在本地CPU或GPU上运行,无需联网或调用云端API。软件当前版本1.11.0.0,安装包仅460KB(模型文件需单独下载),在口袋网下载资源中归类为网络工具,适用于会议记录、字幕制作和采访整理等语音转录场景。

Whisper模型与转录能力

Whisper Desktop支持加载不同规模的Whisper模型,包括tiny、base、small、medium和large五个级别。模型越大,转录准确率越高但推理速度越慢。tiny模型仅39MB,适合快速预览转录效果;large模型约3GB,在GPU加速下可达实时转录速度,准确率接近人工校对水平。

转录支持99种语言的自动识别和转写,中文、英文、日文等主流语种的准确率较高。软件还支持自动语言检测,无需预先指定音频语言。转录结果可以输出为纯文本、SRT字幕和VTT字幕三种格式,SRT和VTT格式包含时间戳信息,可以直接用于视频字幕叠加。

硬件加速与性能

软件支持CPU推理和GPU推理两种模式。CPU模式下使用OpenVINO后端优化推理性能,在Intel i5及以上处理器上运行small模型可达0.5倍实时速度(即1分钟音频需要约2分钟处理)。GPU模式下使用CUDA或DirectML加速,支持NVIDIA显卡(CUDA)和AMD/Intel显卡(DirectML)。

在NVIDIA RTX 3060显卡上运行medium模型,转录速度可达5-8倍实时速度,即1小时音频仅需7-12分钟完成转录。GPU模式需要在设置中选择对应的显卡设备,首次运行时软件会编译模型着色器,耗时3-5分钟,后续运行无需重复编译。

转录参数配置

转录前可以配置多项参数影响转录结果。语言参数可以指定音频语言以跳过自动检测阶段,提升处理速度。初始提示词参数允许提供上下文信息(如人名、专业术语),帮助模型准确识别特定词汇。温度参数控制输出的确定性,值越低结果越稳定一致。

时间戳粒度支持句子级和词级两种。句子级时间戳以自然停顿为分界,适合字幕分段。词级时间戳精确到每个单词的起止时间,可用于卡拉OK式字幕或语音对齐分析。

使用方法

1. 从口袋网下载Whisper Desktop安装包,运行安装程序完成安装。安装后需单独下载Whisper模型文件。

2. 下载模型:启动软件后,点击”模型管理”选项卡,选择需要的模型级别(建议从small开始体验)。点击”下载”按钮,模型文件会保存到软件数据目录中。

3. 加载模型:在主界面”模型”下拉框中选择已下载的模型。首次加载large模型可能需要等待30秒至1分钟。

4. 选择硬件加速:在”设备”下拉框中选择推理后端。如有NVIDIA显卡选择”CUDA”,AMD/Intel显卡选择”DirectML”,无独立显卡选择”CPU”。

5. 导入音频:点击”添加文件”按钮,选择需要转录的音频(WAV、MP3、FLAC、M4A)或视频文件(MP4、MKV)。支持批量添加多个文件。

6. 配置参数:在”语言”下拉框中选择音频语言(如”Chinese”或”English”),或选择”Auto”自动检测。在”输出格式”中选择TXT、SRT或VTT。

7. 点击”开始转录”按钮,进度条显示当前处理进度。转录过程中可以查看实时输出的文本预览。

8. 转录完成后,结果文件自动保存到与源文件相同的目录中,文件名与源文件相同但扩展名改为.txt、.srt或.vtt。

转录质量优化建议

音频质量对转录准确率影响显著。背景噪音较大的录音建议先用音频处理工具降噪。多人对话场景中,分离不同说话人的音频后再分别转录可以获得更准确的结果。对于包含大量专业术语的音频,在初始提示词中填入可能出现的术语列表,能有效提升识别准确率。