PDF'yi harici bir hizmete göndermeden, taranan PDF belgelerinden metni sayfa sayfa çıkarın. Yerleşik `fast` katmanı Tesseract'yi kullanır. İsteğe bağlı`balanced` ve `best` katmanları, sabitlenmiş PP-OCR ONNX modelleriyle RapidOCR'yi kullanır.
Hızlı OCR `auto`, `en`, `de`, `es`, `fr`, `zh` ve `ja` dillerini destekler, ancak Koreceyi (`ko`) desteklemez. Korece için doğru OCR paketi ve `balanced` ya da `best` gerekir. Paket resmi Linux amd64 ve arm64 kapsayıcılarında, OCR’nin CPU’da kaldığı NVIDIA ana bilgisayarları dahil çalışır. Desteklenmeyen sistemler açık bir uyumluluk hatası alır ve sessizce `fast` seçeneğine dönülmez. Korece ile `fast` veya eski `tesseract` diğer adı kuyruk öncesinde `FEATURE_INCOMPATIBLE` ve `fast-korean-unsupported` ile reddedilir.
| enhance | boolean | HAYIR | Seviyeye bağlı | Tanınmadan önce yerel kontrastı iyileştirin. Hızlı doğrudan uygular; Dengeli ve En İyi, yalnızca kalibre edilmiş puanlama sonucu iyileştirdiğinde varyantı korur. `best` için `true` ve `fast`/`balanced` için `false` varsayılanları |
| engine | string | HAYIR | - | Kullanımdan kaldırılan uyumluluk takma adı. Bunun yerine `quality` kullanın. `tesseract`, `fast` ile eşleşir; eski `paddleocr` değeri `balanced` ile eşleşir ancak PaddlePaddle'yi yüklemez |
`quality` ve `engine` belirtilmezse SnapOtter kullanılabilir en iyi katmanı şu sırayla seçer: `best`, `balanced`, `fast`. Korece için `fast` hiçbir zaman seçilmez; `best`, ardından `balanced` kullanılır veya doğru çalışma zamanının kurulum ya da uyumluluk hatası döndürülür.
-`fast` yerleşiktir ve resmi görüntüye yaklaşık 25 MiB ekler. `balanced` ve `best`, isteğe bağlı doğru OCR paketini gerektirir (hedefe bağlı olarak indirmek için yaklaşık 208-234 MiB ve yüklü 409-488 MiB).
- Doğru paket, Linux amd64 ve arm64'yi destekler ve CPU üzerinde ONNX Runtime'yi kullanır, NVIDIA ana bilgisayarları dahil.
- Açıkça talep edilen bir seviye hiçbir zaman sessizce düşürülmez. `balanced` veya `best` kullanılamıyorsa API, `FEATURE_NOT_INSTALLED` veya `FEATURE_INCOMPATIBLE` ile `501`'yi döndürür.
- PDF sayfaları, OCR'den önce yüksek çözünürlükte rasterleştirilir. `best`, daha yüksek doğruluklu orta düzey PP-OCRv6 modellerini çalıştırır ve yönlendirme ve geliştirme değişkenlerini puanlayarak hız pahasına tanınmayı artırır.
-`auto` dil ayarı, desteklenen komut dosyası kümesinde tanımayı etkinleştirir; Açık bir ipucu, bilinen bir belge dili için sonuçları iyileştirebilir.
- Bir istek en fazla 50 sayfa işleyebilir. Rasterleştirilmiş karalama verileri 512 MiB ile sınırlandırılmıştır ve toplam UTF-8 OCR yanıtı 1.000.000 bayt ile sınırlandırılmıştır; limiti aşan işler kısmi metin döndürmek yerine başarısız olur.