Files
SnapOtter/apps/docs/uk/tools/pdf/ocr-pdf.md
T
SnapOtterandGitHub 4963ab3bbd feat(docs-i18n): translate all documentation into 20 languages
All 181 docs markdown files translated into 20 languages (apps/docs/<locale>/**). Companion to the i18n code PR; admin-merged because the file count exceeds GitHub's per-PR CI trigger limit. Validated by pnpm i18n:check (all surfaces, 0 stale/missing) and a clean all-locale docs build.
2026-07-11 13:52:47 +08:00

2.9 KiB

description, i18n_source_hash, i18n_provenance, i18n_output_hash
description i18n_source_hash i18n_provenance i18n_output_hash
Витягання тексту з документів PDF за допомогою OCR на основі ШІ. 1431fcba180b human b0bc3d72aed6

PDF OCR

Витягайте текст з документів PDF за допомогою оптичного розпізнавання символів на основі ШІ. Підтримує кілька рівнів якості та мов. Потребує встановлення набору функцій OCR.

API Endpoint

POST /api/v1/tools/pdf/ocr-pdf

Приймає багаточастинні (multipart) дані форми з файлом PDF та необов'язковим полем JSON settings.

Parameters

Parameter Type Required Default Description
quality string No "balanced" Рівень якості OCR: fast, balanced, best
language string No "auto" Мова документа: auto, en, de, fr, es, zh, ja, ko
pages string No "all" Вибір сторінок, наприклад "all", "1-3", "1,3,5"

Example Request

curl -X POST http://localhost:1349/api/v1/tools/pdf/ocr-pdf \
  -H "Authorization: Bearer si_your-api-key" \
  -F "file=@scanned.pdf" \
  -F 'settings={"quality": "best", "language": "en", "pages": "1-5"}'

Example Response

Повертає 202 Accepted. Відстежуйте перебіг через SSE за адресою /api/v1/jobs/{jobId}/progress.

{
  "jobId": "a1b2c3d4-e5f6-7890-abcd-ef1234567890",
  "async": true
}

Notes

  • Прийнятний формат вхідних даних: .pdf.
  • Це інструмент на основі ШІ, який потребує встановлення набору функцій OCR. Якщо набір не встановлено, API повертає 501 Not Implemented.
  • Рівень якості fast використовує легшу модель для швидшого опрацювання; best використовує точнішу модель за рахунок швидкості.
  • Налаштування мови auto намагається визначити мову документа автоматично.
  • Ви можете націлюватися на конкретні сторінки за допомогою діапазонів ("1-3"), списків через кому ("1,3,5") або "all" для кожної сторінки.
  • Для PDF, які вже містять текст із можливістю виділення, розгляньте використання швидшого інструмента PDF to Text.