本文へスキップ

Pdf Inspector

PDF の検査・分類・テキスト抽出を高速に行う Rust ライブラリ。スキャン PDF とテキストベース PDF を自動で判別する。

開発ツール 1日前
カテゴリー
開発ツール
ウェブサイト
github.com
言語
英語
登録日
1日前
スター
10,192
フォーク
665

firecrawl/pdf-inspector ↗ · Rust · MIT · 最終コミット 23時間前

pdf-inspector は Firecrawl が作った、PDF の分類とテキスト抽出のための高速 Rust ライブラリです。PDF がテキストベースかスキャンかを判別し、位置情報を保ったままテキストを抽出して、きれいな Markdown に変換します。この全工程に OCR を使いません。分類できるからルーティングが賢くなります。プロジェクトの説明では、テキストベースの PDF はローカルで 200ms 以内に処理し、高価な OCR にはスキャン文書だけを回せばよいとのこと。Python、Node.js、ブラウザ WebAssembly のバインディングが用意されています。

この製品が気に入りましたか?