跳到主要內容

全部選單

在自己的電腦上把會議、課程錄音轉成文字

5 款工具, 最後更新 2026-09-16

在這件事上,區分工具的不是宣傳的準確率,而是三點:底層用哪個語音辨識模型、該模型的支援語言裡有沒有韓語、能在哪些裝置上執行。不少工具只支援 Apple Silicon 的 Mac,而檔案轉錄和即時聽寫即使在同一個應用裡也是兩種功能。

韓語使用者尤其要留意一點。多款工具預設使用的 NVIDIA Parakeet 只涵蓋 25 種歐洲語言,沒有韓語。用預設設定轉錄韓語會議,結果會一塌糊塗,很容易誤以為是工具本身的問題。切換到 Whisper 系列或 Qwen3-ASR 即可。

確認方式. 於 2026 年 9 月 14 日閱讀各工具的 GitHub README、官方文件和語音辨識模型的模型卡後寫成。實際安裝並試過韓語錄音的條目標為「已實際安裝」,其餘為「依據文件」。文件沒寫的內容一律寫明未說明。

一覽比較

安裝Meetily依據文件OpenWhispr依據文件Qwen Scribe依據文件Yap依據文件VoiceStudio依據文件
安裝安裝包(.dmg/.exe),Linux 需原始碼建置安裝包(.dmg/.exe/AppImage)原始碼 make(需 Python、ffmpeg)一行 brew 或 .dmg安裝包(.dmg/MSI/AppImage)或 Docker
韓語用 Whisper;Parakeet 無韓語在 Whisper 引擎的 59 種語言裡選韓語在 Qwen3-ASR 官方 30 種語言裡跟隨系統語言,韓語未確認Whisper 系引擎,README 未點名韓語
關鍵限制說話人區分、匯出屬 PRO(每月 10 美元)Intel Mac 無說話人識別僅 Apple Silicon;一次一個檔案,最大 4GBmacOS 26 以上,無檔案轉錄記憶體至少 8GB;Intel Mac 只能用遠端後端

Meetily

逐字稿與摘要都不離開本機的會議助理 30,894依據文件

適合這種情況. 想把整段會議錄音丟進去、一次拿到摘要的時候。適合願意順手裝一個本地 LLM(Ollama)做摘要的人。

安裝過程

  1. macOS:在發布頁下載 Apple Silicon 版 .dmg,拖進「應用程式」資料夾。
  2. Windows:在發布頁下載 x64 安裝包(.exe)。CPU 需支援 AVX2。
  3. Linux:沒有安裝包,只能原始碼建置。需先安裝 Rust 和 Node.js。
  4. 想在本地生成摘要需另裝 Ollama;否則填入 Claude、OpenAI、Groq 或 OpenRouter 的金鑰。

韓語可用性

轉錄引擎在 Whisper(tiny 到 large-v3)和 Parakeet 之間選擇。Parakeet 是 25 種歐洲語言的模型,沒有韓語,所以韓語會議要用 Whisper,看重準確率就選 large-v3。官網寫了多語言支援和語言自動偵測,但沒有給出語言清單。韓語介面未能確認。

實際限制

  • 說話人區分、PDF/DOCX 匯出、語言自動偵測屬於 PRO(每使用者每月 10 美元,按年一次付 120 美元)。社群版以 MIT 授權免費提供。
  • 官方最低配置為記憶體 8GB、4 核、儲存 10GB;建議 16GB、8 核、50GB。large-v3 比這更重。
  • Linux 目前仍只能原始碼建置。

確認日期 2026-09-14, 確認: 依據文件. 根據官方文件和 README 撰寫,未實際安裝試用。

OpenWhispr

在游標處直接轉寫的桌面語音輸入工具。 8,321依據文件

適合這種情況. 寫文件時按下快捷鍵說話,讓文字直接落在游標處。同一個應用也能轉錄會議檔案。

安裝過程

  1. macOS(Apple Silicon 和 Intel)、Windows:發布頁的 .dmg、.exe 安裝包。
  2. Linux:AppImage、.deb、.rpm、.tar.gz 四種。
  3. 原始碼建置需要 Node.js 24 以上:git clone 後執行 npm install、npm run dev。
  4. 本地 Whisper 支援 Metal、CUDA、Vulkan 的 GPU 加速。要用雲端模型需自行填入各服務的 API 金鑰。

韓語可用性

語言在設定 → Preferences → Language 裡選,預設是自動偵測。各引擎支援的語言數不同:Whisper 59 種、Parakeet 26 種、AssemblyAI 7 種。Parakeet 是歐洲語言模型,韓語要選 Whisper。官方文件也建議對短錄音或有雜音的錄音直接指定語言,不要依賴自動偵測。

實際限制

  • Intel Mac 沒有即時說話人識別和聲紋功能:兩者依賴的 ONNX Runtime 從 1.24 起不再提供 macOS x86_64 建置。
  • 筆記功能需登入(免費)。雲端引擎按用量由各服務商收費。
  • MIT 授權,不收集使用記錄。

確認日期 2026-09-14, 確認: 依據文件. 根據官方文件和 README 撰寫,未實際安裝試用。

Qwen Scribe

在 Apple Silicon Mac 上就地完成的轉錄與語音輸入。 213依據文件

適合這種情況. 在 Apple Silicon Mac 上轉錄長錄音,並且想同時帶上字幕(SRT)時間軸的時候。

安裝過程

  1. 僅支援 Apple Silicon Mac,需 macOS 14 以上。
  2. 先安裝 Python 3.12 以上、ffmpeg(brew install ffmpeg)和 Apple 命令列工具(xcode-select --install)。
  3. 拉取儲存庫後用 make setup 建立虛擬環境,再用 make app 產生應用,或用 ./run.sh 啟動後在 http://127.0.0.1:8990 使用。
  4. 沒有 .dmg 安裝包,至少要打開一次終端機。

韓語可用性

使用 Qwen3-ASR 模型,其官方支援的 30 種語言包含韓語。詞級時間軸(SRT)對日語和韓語使用單獨的分詞器,README 有明確說明。語言可以自動偵測或手動指定。模型卡沒有單獨的韓語辨識品質基準。

實際限制

  • 記憶體:1.7B 模型約需 3.4GB 統一記憶體,0.6B 約 1.2GB(量化版為 1.9GB、0.5GB)。
  • 一次只處理一個檔案,最大 4GB。聽寫預設 2 分鐘,最長 10 分鐘。
  • 文件沒有提到說話人區分。Intel Mac、Windows、Linux 不在支援範圍內。
  • Apache-2.0。不需要帳號、API 金鑰或雲端服務。

確認日期 2026-09-14, 確認: 依據文件. 根據官方文件和 README 撰寫,未實際安裝試用。

Yap

全程在本機完成的 macOS 開源語音輸入。 393依據文件

適合這種情況. 用的是 macOS 26,只需要選單列聽寫,不想下載模型或做任何設定的時候。

安裝過程

  1. 一行 brew install --cask frigadehq/tap/yap,或到發布頁下載 .dmg。
  2. 原始碼建置:git clone 後執行 ./install.sh。需要 Xcode 26。
  3. 不用下載模型,不需要 API 金鑰,也不需要帳號。

韓語可用性

直接使用 Apple 的 SpeechAnalyzer 和 SpeechTranscriber,語言跟隨系統地區設定。應用內還沒有語言選擇,路線圖把它列為下一項。Apple 文件沒有公布支援的語言清單,而是讓裝置在執行時查詢,所以韓語聽寫是否可用,得在系統語言設為韓語的 Mac 上親自確認。這一項尚未確認。

實際限制

  • macOS 26(Tahoe)以上,僅 Apple Silicon。不支援 Intel Mac 和 Windows。
  • 只有麥克風即時聽寫,文件沒有提到檔案轉錄。
  • 完全沒有網路程式碼,資料不會離開裝置。記錄用 SwiftData 存在本地。MIT 授權,免費。

確認日期 2026-09-14, 確認: 依據文件. 根據官方文件和 README 撰寫,未實際安裝試用。

VoiceStudio

無需帳號和 API 金鑰、在本機執行的開源語音複製、配音與轉錄工具 32,512依據文件

適合這種情況. 除了轉錄,還想在同一個應用裡做配音、聲音複製和有聲書的時候。不過它比較重。

安裝過程

  1. macOS(Apple Silicon):.dmg。首次啟動需右鍵 → 打開 來核准,此時會自動設定 Python 環境並下載預設模型。
  2. Windows 10/11:x64 MSI(不用管理員權限就選目前使用者版)。Linux:AppImage(glibc 2.39 以上)。
  3. Docker:palashdeb/omnivoice-studio:stable 映像,連接埠 3900。映像只有 linux/amd64。
  4. 原始碼建置需要 Node 20 以上或 Bun,以及 Python 3.11 以上。

韓語可用性

預設辨識引擎是 WhisperX,可在 Faster-Whisper、MLX Whisper、PyTorch Whisper、FunASR 等 11 種引擎中選擇。Whisper 系列支援韓語,但 README 只寫了語言數量(約 100 種),沒有單獨點名韓語。Parakeet TDT 和 Moonshine 分別只支援歐洲語言和英語,韓語檔案不要選它們。韓語介面未能確認。

實際限制

  • 最低配置為記憶體 8GB、磁碟 10GB;建議 16GB 以上、SSD 20GB 以上。用 GPU 需至少 4GB 顯示記憶體,大引擎需要更多。
  • Intel Mac 無法執行本地 Python 後端(只能用遠端後端)。
  • 仍是測試版,AGPL-3.0。下載的模型各自遵循自己的授權;預設 TTS 模型權重為 CC-BY-NC,商業使用受限。

確認日期 2026-09-14, 確認: 依據文件. 根據官方文件和 README 撰寫,未實際安裝試用。