mirror of
https://github.com/snapotter-hq/SnapOtter.git
synced 2026-08-03 07:46:42 +02:00
fix: suppress ML library stdout noise in ocr.py and upscale.py
PaddleOCR prints download/init messages to stdout which corrupts the JSON result that the bridge expects. Same risk with basicsr/realesrgan. Applied the same fd-level stdout redirect pattern already used in remove_bg.py: redirect fd 1 to stderr during ML work, restore for the JSON result. Also added show_log=False to PaddleOCR constructor.
This commit is contained in:
+31
-19
@@ -33,27 +33,39 @@ def run_tesseract(input_path, language):
|
|||||||
def run_paddleocr(input_path, language):
|
def run_paddleocr(input_path, language):
|
||||||
"""Run PaddleOCR."""
|
"""Run PaddleOCR."""
|
||||||
os.environ["PADDLE_PDX_DISABLE_MODEL_SOURCE_CHECK"] = "True"
|
os.environ["PADDLE_PDX_DISABLE_MODEL_SOURCE_CHECK"] = "True"
|
||||||
from paddleocr import PaddleOCR
|
|
||||||
from gpu import gpu_available
|
|
||||||
|
|
||||||
# Map API language codes to PaddleOCR codes
|
# Redirect stdout to stderr so PaddleOCR download/init messages
|
||||||
paddle_lang_map = {"en": "en", "de": "latin", "fr": "latin", "es": "latin", "zh": "ch", "ja": "japan", "ko": "korean"}
|
# cannot contaminate our JSON result on stdout.
|
||||||
paddle_lang = paddle_lang_map.get(language, "en")
|
stdout_fd = os.dup(1)
|
||||||
|
os.dup2(2, 1)
|
||||||
|
|
||||||
|
try:
|
||||||
|
from paddleocr import PaddleOCR
|
||||||
|
from gpu import gpu_available
|
||||||
|
|
||||||
|
# Map API language codes to PaddleOCR codes
|
||||||
|
paddle_lang_map = {"en": "en", "de": "latin", "fr": "latin", "es": "latin", "zh": "ch", "ja": "japan", "ko": "korean"}
|
||||||
|
paddle_lang = paddle_lang_map.get(language, "en")
|
||||||
|
|
||||||
|
emit_progress(20, "Loading")
|
||||||
|
ocr = PaddleOCR(lang=paddle_lang, use_gpu=gpu_available(), show_log=False)
|
||||||
|
emit_progress(30, "Scanning")
|
||||||
|
result = ocr.ocr(input_path)
|
||||||
|
emit_progress(70, "Extracting text")
|
||||||
|
text = "\n".join(
|
||||||
|
[
|
||||||
|
line[1][0]
|
||||||
|
for res in result
|
||||||
|
if res
|
||||||
|
for line in res
|
||||||
|
if line and line[1]
|
||||||
|
]
|
||||||
|
)
|
||||||
|
finally:
|
||||||
|
# Restore stdout
|
||||||
|
os.dup2(stdout_fd, 1)
|
||||||
|
os.close(stdout_fd)
|
||||||
|
|
||||||
emit_progress(20, "Loading")
|
|
||||||
ocr = PaddleOCR(lang=paddle_lang, use_gpu=gpu_available())
|
|
||||||
emit_progress(30, "Scanning")
|
|
||||||
result = ocr.ocr(input_path)
|
|
||||||
emit_progress(70, "Extracting text")
|
|
||||||
text = "\n".join(
|
|
||||||
[
|
|
||||||
line[1][0]
|
|
||||||
for res in result
|
|
||||||
if res
|
|
||||||
for line in res
|
|
||||||
if line and line[1]
|
|
||||||
]
|
|
||||||
)
|
|
||||||
return text, "paddleocr"
|
return text, "paddleocr"
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -31,11 +31,21 @@ def main():
|
|||||||
|
|
||||||
# Try Real-ESRGAN first
|
# Try Real-ESRGAN first
|
||||||
try:
|
try:
|
||||||
from basicsr.archs.rrdbnet_arch import RRDBNet
|
# Redirect stdout to stderr so basicsr/realesrgan init messages
|
||||||
from realesrgan import RealESRGANer
|
# cannot contaminate our JSON result on stdout.
|
||||||
from gpu import gpu_available
|
stdout_fd = os.dup(1)
|
||||||
import numpy as np
|
os.dup2(2, 1)
|
||||||
import torch
|
|
||||||
|
try:
|
||||||
|
from basicsr.archs.rrdbnet_arch import RRDBNet
|
||||||
|
from realesrgan import RealESRGANer
|
||||||
|
from gpu import gpu_available
|
||||||
|
import numpy as np
|
||||||
|
import torch
|
||||||
|
finally:
|
||||||
|
# Restore stdout after imports
|
||||||
|
os.dup2(stdout_fd, 1)
|
||||||
|
os.close(stdout_fd)
|
||||||
|
|
||||||
if not os.path.exists(REALESRGAN_MODEL_PATH):
|
if not os.path.exists(REALESRGAN_MODEL_PATH):
|
||||||
raise FileNotFoundError(f"RealESRGAN model not found: {REALESRGAN_MODEL_PATH}")
|
raise FileNotFoundError(f"RealESRGAN model not found: {REALESRGAN_MODEL_PATH}")
|
||||||
|
|||||||
Reference in New Issue
Block a user