Files
SnapOtter/apps/docs/pt-BR/tools/pdf/ocr-pdf.md
T
SnapOtterandGitHub 4963ab3bbd feat(docs-i18n): translate all documentation into 20 languages
All 181 docs markdown files translated into 20 languages (apps/docs/<locale>/**). Companion to the i18n code PR; admin-merged because the file count exceeds GitHub's per-PR CI trigger limit. Validated by pnpm i18n:check (all surfaces, 0 stale/missing) and a clean all-locale docs build.
2026-07-11 13:52:47 +08:00

2.2 KiB

description, i18n_source_hash, i18n_provenance, i18n_output_hash
description i18n_source_hash i18n_provenance i18n_output_hash
Extraia texto de documentos PDF usando OCR com tecnologia de IA. 1431fcba180b human 42ac624970b5

PDF OCR

Extraia texto de documentos PDF usando reconhecimento óptico de caracteres com tecnologia de IA. Oferece suporte a vários níveis de qualidade e idiomas. Requer que o pacote de recurso OCR esteja instalado.

API Endpoint

POST /api/v1/tools/pdf/ocr-pdf

Aceita dados de formulário multipart com um arquivo PDF e um campo JSON settings opcional.

Parameters

Parâmetro Tipo Obrigatório Padrão Descrição
quality string Não "balanced" Nível de qualidade do OCR: fast, balanced, best
language string Não "auto" Idioma do documento: auto, en, de, fr, es, zh, ja, ko
pages string Não "all" Seleção de páginas, por exemplo "all", "1-3", "1,3,5"

Example Request

curl -X POST http://localhost:1349/api/v1/tools/pdf/ocr-pdf \
  -H "Authorization: Bearer si_your-api-key" \
  -F "file=@scanned.pdf" \
  -F 'settings={"quality": "best", "language": "en", "pages": "1-5"}'

Example Response

Retorna 202 Accepted. Acompanhe o progresso via SSE em /api/v1/jobs/{jobId}/progress.

{
  "jobId": "a1b2c3d4-e5f6-7890-abcd-ef1234567890",
  "async": true
}

Notes

  • Formato de entrada aceito: .pdf.
  • Esta é uma ferramenta de IA que requer que o pacote de recurso OCR esteja instalado. Se o pacote não estiver instalado, a API retorna 501 Not Implemented.
  • O nível de qualidade fast usa um modelo mais leve para processamento mais rápido; best usa um modelo mais preciso ao custo de velocidade.
  • A configuração de idioma auto tenta detectar o idioma do documento automaticamente.
  • Você pode direcionar páginas específicas usando intervalos ("1-3"), listas separadas por vírgula ("1,3,5") ou "all" para todas as páginas.
  • Para PDFs que já contêm texto selecionável, considere usar a ferramenta PDF to Text, que é mais rápida.