Extraheer tekst uit gescande PDF-documenten pagina voor pagina zonder de PDF naar een externe service te sturen. De ingebouwde `fast`-laag maakt gebruik van Tesseract. De optionele lagen `balanced` en `best` gebruiken RapidOCR met vastgezette PP-OCR ONNX-modellen.
Snelle OCR ondersteunt `auto`, `en`, `de`, `es`, `fr`, `zh` en `ja`, maar geen Koreaans (`ko`). Koreaans vereist het nauwkeurige OCR-pakket en `balanced` of `best`. Het pakket werkt in officiële Linux amd64- en arm64-containers, ook op NVIDIA-hosts waar OCR op de CPU blijft draaien. Niet-ondersteunde systemen krijgen een expliciete compatibiliteitsfout en vallen nooit stil terug op `fast`. Koreaans met `fast` of de oude alias `tesseract` wordt vóór het in de wachtrij plaatsen geweigerd met `FEATURE_INCOMPATIBLE` en `fast-korean-unsupported`.
| enhance | boolean | Nee | Niveau-afhankelijk | Verbeter het lokale contrast vóór herkenning. Snel past het direct toe; Gebalanceerd en Best behouden de variant alleen als gekalibreerde scores het resultaat verbeteren. Standaard ingesteld op `true` voor `best` en `false` voor `fast`/`balanced` |
| engine | string | Nee | - | Verouderde compatibiliteitsalias. Gebruik in plaats daarvan `quality`. `tesseract` wordt toegewezen aan `fast`; de oude `paddleocr`-waarde wordt toegewezen aan `balanced` maar laadt PaddlePaddle niet |
Als `quality` en `engine` zijn weggelaten, kiest SnapOtter de beste beschikbare laag in deze volgorde: `best`, `balanced`, `fast`. Voor Koreaans wordt `fast` nooit gekozen; het gebruikt `best`, daarna `balanced`, of geeft een installatie- of compatibiliteitsfout voor de nauwkeurige runtime terug.
-`fast` is ingebouwd en voegt ongeveer 25 MiB toe aan de officiële afbeelding. Voor `balanced` en `best` is het optionele, nauwkeurige OCR-pakket vereist (ongeveer 208-234 MiB om te downloaden en 409-488 MiB geïnstalleerd, afhankelijk van het doel).
- Het nauwkeurige pakket ondersteunt Linux amd64 en arm64 en gebruikt ONNX Runtime op CPU, inclusief op NVIDIA-hosts.
- Een expliciet aangevraagd niveau wordt nooit stilzwijgend gedegradeerd. Als `balanced` of `best` niet beschikbaar is, retourneert de API `501` met `FEATURE_NOT_INSTALLED` of `FEATURE_INCOMPATIBLE`.
- PDF-pagina's worden vóór OCR met hoge resolutie gerasterd. `best` voert de PP-OCRv6-modellen met hogere nauwkeurigheid uit en scoort oriëntatie- en verbeteringsvarianten, waardoor de herkenning wordt verbeterd ten koste van de snelheid.
- De taalinstelling `auto` maakt herkenning via de ondersteunde scriptset mogelijk; een expliciete hint kan de resultaten voor een bekende documenttaal verbeteren.
- Een aanvraag kan maximaal 50 pagina's verwerken. Gerasterde scratch-gegevens zijn beperkt tot 512 MiB en de totale UTF-8 OCR-respons is beperkt tot 1.000.000 bytes; taken die te hoog zijn, mislukken in plaats van een gedeeltelijke tekst terug te geven.