본문 바로가기

전체 메뉴

회의, 강의 녹음을 내 컴퓨터에서 글로 옮기기

도구 5개, 마지막 수정 2026-09-16

이 일에서 도구를 가르는 기준은 정확도 광고가 아니라 세 가지입니다. 어떤 음성 인식 모델을 쓰는지, 그 모델의 지원 언어 목록에 한국어가 있는지, 어떤 기기에서 작동하는지입니다. 애플 실리콘 맥에서만 쓸 수 있는 도구가 많고, 파일 전사와 실시간 받아쓰기는 한 앱 안에서도 서로 다른 기능입니다.

한국어에서 특히 주의할 점이 하나 있습니다. 여러 도구가 기본으로 쓰는 NVIDIA Parakeet은 유럽 언어 25개를 지원하는 모델이라 한국어가 없습니다. 기본 설정으로 한국어 회의를 전사하면 결과가 엉망인데, 도구 자체의 문제로 오해하기 쉽습니다. Whisper 계열이나 Qwen3-ASR로 바꾸면 됩니다.

확인 방법. 2026년 9월 14일에 각 도구의 GitHub README와 공식 문서, 음성 인식 모델의 모델 카드를 읽고 작성했습니다. 직접 설치해 한국어 녹음을 넣어 본 항목에는 「직접 설치」 표시가 붙고, 그렇지 않은 항목은 「문서 기준」입니다. 문서에 나오지 않는 내용은 없다고 적었습니다.

한눈에 비교

설치Meetily문서 기준OpenWhispr문서 기준Qwen Scribe문서 기준Yap문서 기준VoiceStudio문서 기준
설치앱 설치(.dmg, .exe), Linux는 소스 빌드앱 설치(.dmg, .exe, AppImage)소스에서 make(Python, ffmpeg 필요)brew 한 줄 또는 .dmg앱 설치(.dmg, MSI, AppImage) 또는 Docker
한국어Whisper로. Parakeet은 한국어 없음Whisper 엔진 59개 언어에서 선택Qwen3-ASR 공식 지원 30개 언어에 포함시스템 로케일을 따름, 지원 목록은 미확인Whisper 계열 엔진, README에 한국어 미명시
핵심 제약화자 구분, 내보내기는 PRO(월 10달러)인텔 맥은 화자 식별 없음애플 실리콘 전용, 파일은 한 번에 하나(최대 4GB)macOS 26 이상, 파일 전사 없음RAM 8GB 이상, 인텔 맥은 원격 백엔드만

Meetily

전사도 요약도 기기 안에서 끝나는 회의 도구. 30,894문서 기준

이런 경우에. 회의 녹음을 통째로 넣어 요약까지 한 번에 받고 싶을 때. 요약용 로컬 LLM(Ollama)도 함께 설치해 둘 사람.

설치 과정

  1. macOS: 릴리스 페이지에서 .dmg(애플 실리콘)를 받아 응용 프로그램 폴더로 끌어다 놓습니다.
  2. Windows: 릴리스 페이지에서 x64 설치 파일(.exe)을 받습니다. CPU가 AVX2를 지원해야 합니다.
  3. Linux: 설치본이 없고 소스 빌드만 됩니다. Rust와 Node.js가 먼저 있어야 합니다.
  4. 요약을 로컬에서 받으려면 Ollama를 따로 설치해야 합니다. 그렇지 않으면 Claude, OpenAI, Groq, OpenRouter 키를 넣습니다.

한국어 사용성

전사 엔진은 Whisper(tiny부터 large-v3까지)와 Parakeet 중에서 고릅니다. Parakeet은 유럽 언어 25개를 지원하는 모델이라 한국어가 없습니다. 한국어 회의에는 Whisper를 쓰고, 정확도가 중요하면 large-v3를 고릅니다. 공식 사이트에는 다국어 지원과 언어 자동 감지가 적혀 있지만, 지원 언어 목록은 따로 없습니다. 한국어 UI는 확인하지 못했습니다.

실제 제약

  • 화자 구분, PDF, DOCX 내보내기, 언어 자동 감지는 PRO(사용자당 월 10달러, 연 120달러 일괄 결제)에 포함됩니다. 커뮤니티판은 MIT 라이선스로 무료입니다.
  • 공식 최소 사양은 RAM 8GB, 4코어, 저장 공간 10GB이며, 권장 사양은 16GB, 8코어, 50GB입니다. large-v3는 이보다 무겁습니다.
  • Linux는 아직 소스 빌드만 지원합니다.

확인일 2026-09-14, 확인: 문서 기준. 공식 문서와 README를 읽고 적었습니다. 직접 설치해 보지는 않았습니다.

OpenWhispr

커서 자리에 바로 받아쓰는 데스크톱 음성 입력 도구. 8,321문서 기준

이런 경우에. 문서를 쓰다가 단축키를 누르고 말한 내용을 커서 자리에 바로 붙이고 싶을 때. 같은 앱에서 회의 파일도 전사할 수 있습니다.

설치 과정

  1. macOS(애플 실리콘, 인텔), Windows: 릴리스 페이지의 .dmg, .exe 설치 파일.
  2. Linux: AppImage, .deb, .rpm, .tar.gz 네 가지.
  3. 소스 빌드에는 Node.js 24 이상이 필요합니다. git clone 뒤 npm install, npm run dev를 실행합니다.
  4. 로컬 Whisper는 Metal, CUDA, Vulkan으로 GPU 가속을 지원합니다. 클라우드 모델을 쓰려면 각 서비스의 API 키를 직접 넣습니다.

한국어 사용성

언어는 설정 → Preferences → Language에서 고르며, 기본값은 자동 감지입니다. 엔진마다 지원 언어 수가 다릅니다. Whisper 59개, Parakeet 26개, AssemblyAI 7개입니다. Parakeet은 유럽 언어 모델이라 한국어에는 Whisper를 골라야 합니다. 공식 문서에도 짧거나 잡음이 섞인 녹음은 자동 감지보다 언어를 직접 지정하라고 적혀 있습니다.

실제 제약

  • 인텔 맥에서는 실시간 화자 식별과 음성 지문 기능이 빠집니다. 두 기능이 사용하는 ONNX 런타임이 1.24부터 macOS x86_64 빌드를 내지 않기 때문입니다.
  • 노트 기능을 쓰려면 로그인해야 합니다(무료). 클라우드 엔진은 사용량만큼 해당 서비스에 요금이 붙습니다.
  • MIT 라이선스이며 사용 기록을 수집하지 않습니다.

확인일 2026-09-14, 확인: 문서 기준. 공식 문서와 README를 읽고 적었습니다. 직접 설치해 보지는 않았습니다.

Qwen Scribe

기기 안에서 끝나는 애플 실리콘 맥용 전사와 받아쓰기. 213문서 기준

이런 경우에. 애플 실리콘 맥에서 긴 녹음 파일을 전사하면서 자막(SRT) 시간표까지 함께 뽑고 싶을 때.

설치 과정

  1. 애플 실리콘 맥 전용이며 macOS 14 이상에서 작동합니다.
  2. Python 3.12 이상과 ffmpeg(brew install ffmpeg), Apple 명령줄 도구(xcode-select --install)를 먼저 설치해야 합니다.
  3. 저장소를 받아 make setup으로 가상환경을 만들고, make app으로 앱을 만들거나 ./run.sh로 실행해 http://127.0.0.1:8990에서 씁니다.
  4. 설치 파일(.dmg)은 없습니다. 터미널을 한 번은 열어야 합니다.

한국어 사용성

Qwen3-ASR 모델을 쓰며, 이 모델의 공식 지원 언어 30개에 한국어가 포함됩니다. 단어 단위 시간표(SRT)는 일본어와 한국어용 토크나이저를 따로 얹어 만들며, README에 이를 명시했습니다. 언어는 자동 감지와 직접 지정 중에서 고릅니다. 한국어 인식 품질에 관한 별도 벤치마크는 모델 카드에 없습니다.

실제 제약

  • 메모리: 1.7B 모델은 약 3.4GB, 0.6B는 약 1.2GB의 통합 메모리를 씁니다(양자화판은 1.9GB, 0.5GB).
  • 파일은 한 번에 하나만 처리하며 최대 4GB까지 가능합니다. 받아쓰기는 기본 2분, 최대 10분입니다.
  • 화자 구분은 문서에 없습니다. 인텔 맥, Windows, Linux는 대상이 아닙니다.
  • Apache-2.0입니다. 계정, API 키, 클라우드를 쓰지 않습니다.

확인일 2026-09-14, 확인: 문서 기준. 공식 문서와 README를 읽고 적었습니다. 직접 설치해 보지는 않았습니다.

Yap

기기 안에서 끝나는 macOS 받아쓰기. 393문서 기준

이런 경우에. macOS 26을 쓰고, 모델을 내려받거나 설정할 필요 없이 메뉴 막대 받아쓰기 기능만 있으면 될 때.

설치 과정

  1. brew install --cask frigadehq/tap/yap 한 줄로 설치하거나 릴리스 페이지에서 .dmg을 받습니다.
  2. 소스 빌드는 git clone 뒤 ./install.sh를 실행합니다. Xcode 26이 필요합니다.
  3. 내려받을 모델도 API 키도 계정도 필요 없습니다.

한국어 사용성

Apple의 SpeechAnalyzer와 SpeechTranscriber를 그대로 쓰며, 언어는 시스템 로케일을 따릅니다. 앱 안에 언어 선택 기능은 아직 없고, 로드맵의 다음 항목으로 적혀 있습니다. Apple 문서는 지원 언어 목록을 제공하지 않고 기기에서 조회하도록 해 두었습니다. 따라서 한국어 받아쓰기가 되는지는 macOS 언어를 한국어로 설정한 기기에서 직접 확인해야 합니다. 이 항목은 아직 확인이 남아 있습니다.

실제 제약

  • macOS 26(Tahoe) 이상에서 애플 실리콘만 지원합니다. 인텔 맥과 Windows는 지원하지 않습니다.
  • 마이크를 이용한 실시간 받아쓰기만 있고, 파일 전사는 문서에 없습니다.
  • 네트워크 코드가 아예 없어 데이터가 기기 밖으로 나가지 않습니다. 기록은 SwiftData로 로컬에 저장합니다. MIT 라이선스로 무료입니다.

확인일 2026-09-14, 확인: 문서 기준. 공식 문서와 README를 읽고 적었습니다. 직접 설치해 보지는 않았습니다.

VoiceStudio

계정도 API 키도 없이 내 컴퓨터에서 작동하는 오픈소스 음성 복제, 더빙, 전사 도구 32,512문서 기준

이런 경우에. 전사뿐 아니라 더빙, 음성 복제, 오디오북까지 한 앱에서 하고 싶을 때. 다만 무거운 편입니다.

설치 과정

  1. macOS(애플 실리콘): .dmg. 처음 실행할 때는 우클릭 → 열기로 승인해야 합니다. 이때 Python 환경과 기본 모델을 자동으로 내려받습니다.
  2. Windows 10/11: x64 MSI(관리자 권한 없이 설치하려면 현재 사용자용 빌드). Linux: AppImage(glibc 2.39 이상).
  3. Docker: palashdeb/omnivoice-studio:stable 이미지, 포트 3900. 이미지는 linux/amd64만 지원합니다.
  4. 소스 빌드에는 Node 20 이상 또는 Bun, Python 3.11 이상이 필요합니다.

한국어 사용성

기본 인식 엔진은 WhisperX이며, Faster-Whisper, MLX Whisper, PyTorch Whisper, FunASR 등 11종 중에서 고를 수 있습니다. Whisper 계열은 한국어를 지원하지만, README에는 지원 언어 수(약 100개)만 적혀 있고 한국어를 따로 명시하지 않습니다. Parakeet TDT와 Moonshine은 각각 유럽 언어, 영어 전용이라 한국어 파일에는 고르지 않습니다. 한국어 UI는 확인하지 못했습니다.

실제 제약

  • 최소 사양은 RAM 8GB, 디스크 10GB이며, 권장 사양은 16GB 이상, SSD 20GB 이상입니다. GPU를 쓰려면 VRAM 4GB 이상이 필요하고, 큰 엔진은 더 많이 필요합니다.
  • 인텔 맥은 로컬 Python 백엔드를 실행할 수 없습니다(원격 백엔드만).
  • 아직 베타이며 AGPL-3.0입니다. 내려받는 모델은 각각의 라이선스를 따릅니다. 기본 TTS 모델 가중치는 CC-BY-NC라 상업 이용에 제한이 붙습니다.

확인일 2026-09-14, 확인: 문서 기준. 공식 문서와 README를 읽고 적었습니다. 직접 설치해 보지는 않았습니다.