確認日 2026-08-28
ブラウザで PDF をページ単位 OCR
選択ページを制御した DPI でローカル描画し、順番に認識します。
入力例
Scanned PDF; pages 1-3; 216 DPI
期待される出力
===== Page 1 ===== Recognized text
再現可能な手順
- 原本を保持し、問題を再現できる最小のサンプルを作成します。
- 変換前に厳密な解析または検証を実行します。
- 設定を記録し、件数と構造を比較してから受け側のシステムで試します。
よくあるエラー
暗号化ファイル、極端な DPI、複雑な配置では失敗します。
原因となる構造を残したまま失敗例を小さくすると、不正な入力と未対応動作を切り分けられます。
技術的な制限
プレーンテキスト OCR は表や正確な読み順を保持しません。
プレビューの成功は、形式の曖昧さや後続システムの要件を解消するものではありません。
セキュリティとプライバシー
PDF はローカルに保ち、各処理後に Canvas と Worker メモリを解放します。
ローカル処理は転送リスクを減らしますが、侵害されたブラウザ、危険な拡張機能、クリップボード履歴、後からの誤用までは防げません。
確認チェックリスト
- フィールド数、レコード数、ページ数、またはバイト数を確認します。
- 境界条件とエラー出力を確認します。
- 受け入れ確認が終わるまで原本を保持します。
- 自動化に使う前提条件を記録します。