Files
SnapOtter/apps/docs/id/tools/pdf/ocr-pdf.md
T
SnapOtterandGitHub 4963ab3bbd feat(docs-i18n): translate all documentation into 20 languages
All 181 docs markdown files translated into 20 languages (apps/docs/<locale>/**). Companion to the i18n code PR; admin-merged because the file count exceeds GitHub's per-PR CI trigger limit. Validated by pnpm i18n:check (all surfaces, 0 stale/missing) and a clean all-locale docs build.
2026-07-11 13:52:47 +08:00

2.1 KiB

description, i18n_source_hash, i18n_provenance, i18n_output_hash
description i18n_source_hash i18n_provenance i18n_output_hash
Ekstrak teks dari dokumen PDF menggunakan OCR bertenaga AI. 1431fcba180b human ec3055271630

PDF OCR

Ekstrak teks dari dokumen PDF menggunakan pengenalan karakter optik bertenaga AI. Mendukung beberapa tingkat kualitas dan bahasa. Membutuhkan feature bundle OCR untuk terpasang.

API Endpoint

POST /api/v1/tools/pdf/ocr-pdf

Menerima data form multipart berisi file PDF dan sebuah field JSON settings opsional.

Parameters

Parameter Type Required Default Description
quality string No "balanced" Tingkat kualitas OCR: fast, balanced, best
language string No "auto" Bahasa dokumen: auto, en, de, fr, es, zh, ja, ko
pages string No "all" Pemilihan halaman, mis. "all", "1-3", "1,3,5"

Example Request

curl -X POST http://localhost:1349/api/v1/tools/pdf/ocr-pdf \
  -H "Authorization: Bearer si_your-api-key" \
  -F "file=@scanned.pdf" \
  -F 'settings={"quality": "best", "language": "en", "pages": "1-5"}'

Example Response

Mengembalikan 202 Accepted. Lacak progres melalui SSE di /api/v1/jobs/{jobId}/progress.

{
  "jobId": "a1b2c3d4-e5f6-7890-abcd-ef1234567890",
  "async": true
}

Notes

  • Format input yang diterima: .pdf.
  • Ini adalah alat AI yang membutuhkan feature bundle OCR untuk terpasang. Jika bundle tidak terpasang, API mengembalikan 501 Not Implemented.
  • Tingkat kualitas fast menggunakan model yang lebih ringan untuk pemrosesan lebih cepat; best menggunakan model yang lebih akurat dengan mengorbankan kecepatan.
  • Pengaturan bahasa auto mencoba mendeteksi bahasa dokumen secara otomatis.
  • Anda dapat menargetkan halaman tertentu menggunakan rentang ("1-3"), daftar yang dipisahkan koma ("1,3,5"), atau "all" untuk setiap halaman.
  • Untuk PDF yang sudah berisi teks yang dapat dipilih, pertimbangkan untuk menggunakan alat PDF to Text yang lebih cepat.