Files
SnapOtter/apps/docs/pl/tools/pdf/ocr-pdf.md
T
SnapOtterandGitHub 4963ab3bbd feat(docs-i18n): translate all documentation into 20 languages
All 181 docs markdown files translated into 20 languages (apps/docs/<locale>/**). Companion to the i18n code PR; admin-merged because the file count exceeds GitHub's per-PR CI trigger limit. Validated by pnpm i18n:check (all surfaces, 0 stale/missing) and a clean all-locale docs build.
2026-07-11 13:52:47 +08:00

2.1 KiB

description, i18n_source_hash, i18n_provenance, i18n_output_hash
description i18n_source_hash i18n_provenance i18n_output_hash
Wyodrębnij tekst z dokumentów PDF za pomocą OCR opartego na AI. 1431fcba180b human 7cd3408b836e

PDF OCR

Wyodrębnij tekst z dokumentów PDF za pomocą optycznego rozpoznawania znaków (OCR) opartego na AI. Obsługuje wiele poziomów jakości i języków. Wymaga zainstalowania pakietu funkcji OCR.

API Endpoint

POST /api/v1/tools/pdf/ocr-pdf

Przyjmuje dane formularza multipart z plikiem PDF oraz opcjonalnym polem JSON settings.

Parameters

Parameter Type Required Default Description
quality string No "balanced" Poziom jakości OCR: fast, balanced, best
language string No "auto" Język dokumentu: auto, en, de, fr, es, zh, ja, ko
pages string No "all" Wybór stron, np. "all", "1-3", "1,3,5"

Example Request

curl -X POST http://localhost:1349/api/v1/tools/pdf/ocr-pdf \
  -H "Authorization: Bearer si_your-api-key" \
  -F "file=@scanned.pdf" \
  -F 'settings={"quality": "best", "language": "en", "pages": "1-5"}'

Example Response

Zwraca 202 Accepted. Śledź postęp przez SSE pod /api/v1/jobs/{jobId}/progress.

{
  "jobId": "a1b2c3d4-e5f6-7890-abcd-ef1234567890",
  "async": true
}

Notes

  • Akceptowany format wejściowy: .pdf.
  • To narzędzie AI, które wymaga zainstalowania pakietu funkcji OCR. Jeśli pakiet nie jest zainstalowany, API zwraca 501 Not Implemented.
  • Poziom jakości fast używa lżejszego modelu do szybszego przetwarzania; best używa dokładniejszego modelu kosztem szybkości.
  • Ustawienie języka auto próbuje automatycznie wykryć język dokumentu.
  • Możesz wskazać konkretne strony za pomocą zakresów ("1-3"), list rozdzielonych przecinkami ("1,3,5") lub "all" dla każdej strony.
  • W przypadku plików PDF, które już zawierają zaznaczalny tekst, rozważ użycie szybszego narzędzia PDF to Text.