跳到主要内容

全部菜单

在自己的电脑上把会议、课程录音转成文字

5 款工具, 最后更新 2026-09-16

在这件事上,区分工具的不是宣传的准确率,而是三点:底层用哪个语音识别模型、该模型的支持语言里有没有韩语、能在哪些设备上运行。不少工具只支持 Apple Silicon 的 Mac,而文件转写和实时听写即使在同一个应用里也是两种功能。

韩语用户尤其要留意一点。多款工具默认使用的 NVIDIA Parakeet 只覆盖 25 种欧洲语言,没有韩语。用默认设置转写韩语会议,结果会一塌糊涂,很容易误以为是工具本身的问题。切换到 Whisper 系列或 Qwen3-ASR 即可。

确认方式. 于 2026 年 9 月 14 日阅读各工具的 GitHub README、官方文档和语音识别模型的模型卡后写成。实际安装并试过韩语录音的条目标为「已实际安装」,其余为「依据文档」。文档没写的内容一律写明未说明。

一览比较

安装Meetily依据文档OpenWhispr依据文档Qwen Scribe依据文档Yap依据文档VoiceStudio依据文档
安装安装包(.dmg/.exe),Linux 需源码构建安装包(.dmg/.exe/AppImage)源码 make(需 Python、ffmpeg)一行 brew 或 .dmg安装包(.dmg/MSI/AppImage)或 Docker
韩语用 Whisper;Parakeet 无韩语在 Whisper 引擎的 59 种语言里选韩语在 Qwen3-ASR 官方 30 种语言里跟随系统语言,韩语未确认Whisper 系引擎,README 未点名韩语
关键限制说话人区分、导出属 PRO(每月 10 美元)Intel Mac 无说话人识别仅 Apple Silicon;一次一个文件,最大 4GBmacOS 26 以上,无文件转写内存至少 8GB;Intel Mac 只能用远程后端

Meetily

转写和摘要都留在本机的会议工具。 30,894依据文档

适合这种情况. 想把整段会议录音丢进去、一次拿到摘要的时候。适合愿意顺手装一个本地 LLM(Ollama)做摘要的人。

安装过程

  1. macOS:在发布页下载 Apple Silicon 版 .dmg,拖进「应用程序」文件夹。
  2. Windows:在发布页下载 x64 安装包(.exe)。CPU 需支持 AVX2。
  3. Linux:没有安装包,只能源码构建。需先安装 Rust 和 Node.js。
  4. 想在本地生成摘要需另装 Ollama;否则填入 Claude、OpenAI、Groq 或 OpenRouter 的密钥。

韩语可用性

转写引擎在 Whisper(tiny 到 large-v3)和 Parakeet 之间选择。Parakeet 是 25 种欧洲语言的模型,没有韩语,所以韩语会议要用 Whisper,看重准确率就选 large-v3。官网写了多语言支持和语言自动检测,但没有给出语言列表。韩语界面未能确认。

实际限制

  • 说话人区分、PDF/DOCX 导出、语言自动检测属于 PRO(每用户每月 10 美元,按年一次付 120 美元)。社区版以 MIT 许可证免费提供。
  • 官方最低配置为内存 8GB、4 核、存储 10GB;推荐 16GB、8 核、50GB。large-v3 比这更重。
  • Linux 目前仍只能源码构建。

确认日期 2026-09-14, 确认: 依据文档. 根据官方文档和 README 撰写,未实际安装试用。

OpenWhispr

在光标处直接转写的桌面语音输入工具。 8,321依据文档

适合这种情况. 写文档时按下快捷键说话,让文字直接落在光标处。同一个应用也能转写会议文件。

安装过程

  1. macOS(Apple Silicon 和 Intel)、Windows:发布页的 .dmg、.exe 安装包。
  2. Linux:AppImage、.deb、.rpm、.tar.gz 四种。
  3. 源码构建需要 Node.js 24 以上:git clone 后执行 npm install、npm run dev。
  4. 本地 Whisper 支持 Metal、CUDA、Vulkan 的 GPU 加速。要用云端模型需自行填入各服务的 API 密钥。

韩语可用性

语言在设置 → Preferences → Language 里选,默认是自动检测。各引擎支持的语言数不同:Whisper 59 种、Parakeet 26 种、AssemblyAI 7 种。Parakeet 是欧洲语言模型,韩语要选 Whisper。官方文档也建议对短录音或有杂音的录音直接指定语言,不要依赖自动检测。

实际限制

  • Intel Mac 没有实时说话人识别和声纹功能:两者依赖的 ONNX Runtime 从 1.24 起不再提供 macOS x86_64 构建。
  • 笔记功能需登录(免费)。云端引擎按用量由各服务商收费。
  • MIT 许可证,不收集使用记录。

确认日期 2026-09-14, 确认: 依据文档. 根据官方文档和 README 撰写,未实际安装试用。

Qwen Scribe

转录和语音输入都留在 Apple Silicon Mac 上。 213依据文档

适合这种情况. 在 Apple Silicon Mac 上转写长录音,并且想同时带上字幕(SRT)时间轴的时候。

安装过程

  1. 仅支持 Apple Silicon Mac,需 macOS 14 以上。
  2. 先安装 Python 3.12 以上、ffmpeg(brew install ffmpeg)和 Apple 命令行工具(xcode-select --install)。
  3. 拉取仓库后用 make setup 创建虚拟环境,再用 make app 生成应用,或用 ./run.sh 启动后在 http://127.0.0.1:8990 使用。
  4. 没有 .dmg 安装包,至少要打开一次终端。

韩语可用性

使用 Qwen3-ASR 模型,其官方支持的 30 种语言包含韩语。词级时间轴(SRT)对日语和韩语使用单独的分词器,README 有明确说明。语言可以自动检测或手动指定。模型卡没有单独的韩语识别质量基准。

实际限制

  • 内存:1.7B 模型约需 3.4GB 统一内存,0.6B 约 1.2GB(量化版为 1.9GB、0.5GB)。
  • 一次只处理一个文件,最大 4GB。听写默认 2 分钟,最长 10 分钟。
  • 文档没有提到说话人区分。Intel Mac、Windows、Linux 不在支持范围内。
  • Apache-2.0。不需要账号、API 密钥或云服务。

确认日期 2026-09-14, 确认: 依据文档. 根据官方文档和 README 撰写,未实际安装试用。

Yap

全程在本机完成的 macOS 开源语音输入。 393依据文档

适合这种情况. 用的是 macOS 26,只需要菜单栏听写,不想下载模型或做任何设置的时候。

安装过程

  1. 一行 brew install --cask frigadehq/tap/yap,或到发布页下载 .dmg。
  2. 源码构建:git clone 后执行 ./install.sh。需要 Xcode 26。
  3. 不用下载模型,不需要 API 密钥,也不需要账号。

韩语可用性

直接使用 Apple 的 SpeechAnalyzer 和 SpeechTranscriber,语言跟随系统区域设置。应用内还没有语言选择,路线图把它列为下一项。Apple 文档没有公布支持的语言列表,而是让设备在运行时查询,所以韩语听写是否可用,得在系统语言设为韩语的 Mac 上亲自确认。这一项尚未确认。

实际限制

  • macOS 26(Tahoe)以上,仅 Apple Silicon。不支持 Intel Mac 和 Windows。
  • 只有麦克风实时听写,文档没有提到文件转写。
  • 完全没有网络代码,数据不会离开设备。记录用 SwiftData 存在本地。MIT 许可证,免费。

确认日期 2026-09-14, 确认: 依据文档. 根据官方文档和 README 撰写,未实际安装试用。

VoiceStudio

无需账号和 API 密钥、在本机运行的开源语音克隆、配音与转写工具 32,512依据文档

适合这种情况. 除了转写,还想在同一个应用里做配音、声音克隆和有声书的时候。不过它比较重。

安装过程

  1. macOS(Apple Silicon):.dmg。首次启动需右键 → 打开 来批准,此时会自动配置 Python 环境并下载默认模型。
  2. Windows 10/11:x64 MSI(不用管理员权限就选当前用户版)。Linux:AppImage(glibc 2.39 以上)。
  3. Docker:palashdeb/omnivoice-studio:stable 镜像,端口 3900。镜像只有 linux/amd64。
  4. 源码构建需要 Node 20 以上或 Bun,以及 Python 3.11 以上。

韩语可用性

默认识别引擎是 WhisperX,可在 Faster-Whisper、MLX Whisper、PyTorch Whisper、FunASR 等 11 种引擎中选择。Whisper 系列支持韩语,但 README 只写了语言数量(约 100 种),没有单独点名韩语。Parakeet TDT 和 Moonshine 分别只支持欧洲语言和英语,韩语文件不要选它们。韩语界面未能确认。

实际限制

  • 最低配置为内存 8GB、磁盘 10GB;推荐 16GB 以上、SSD 20GB 以上。用 GPU 需至少 4GB 显存,大引擎需要更多。
  • Intel Mac 无法运行本地 Python 后端(只能用远程后端)。
  • 仍是测试版,AGPL-3.0。下载的模型各自遵循自己的许可证;默认 TTS 模型权重为 CC-BY-NC,商业使用受限。

确认日期 2026-09-14, 确认: 依据文档. 根据官方文档和 README 撰写,未实际安装试用。