READEX · Benchmark OCR

Mesures réelles sur les mêmes fichiers, dans le même ordre. Les configurations s'exécutent successivement, sans GPU.

ConfigurationImagesTotal MoyenneMédianeP95P99Images/sErreurs

PP-OCRv6 small est le candidat principal des premiers essais de qualité. La vitesse ne mesure pas la qualité de transcription. Un texte vide peut être correct.

Mesures partielles arrêtées

Durées effectivement mesurées, sans extrapolation au corpus complet. Les conditions CPU et le détecteur peuvent différer des lots complets.

ConfigurationImages / cible Total mesuréMoyenneP95CœursDétecteur

Chargement et protocole

ConfigurationCœursDétecteurInitialisation Échauffement · 3 imagesMur du lot

L'OCR chronométré inclut le décodage du PNG, la détection, l'orientation et la reconnaissance. RapidOCR garde ses modèles chargés pendant le lot. Tesseract est appelé par son CLI pour chaque image : lancement du processus et chargement de fra+eng sont inclus dans chaque durée.

Hors chronométrage OCR : lectures MySQL, téléchargement S3, conversion initiale en RGB, écriture des résultats, chargement initial de RapidOCR et trois images d'échauffement. Les PNG gardent la résolution d'origine ; transparence sur blanc, orientation EXIF appliquée et première frame uniquement pour les animations.

Versions et données techniques

Une passe par moteur ; les lots interrompus sont signalés. Les percentiles utilisent une interpolation linéaire. Le total additionne les durées mesurées des images ; le débit vaut nombre d'images divisé par ce total. Le mur du lot inclut aussi les checkpoints. Ces mesures portent sur ce poste et ce corpus équilibré, sans extrapolation au trafic réel ni intervalle de confiance entre plusieurs campagnes.

TikTok : images associées à des Ads vidéo, aucune vidéo complète traitée. Rekognition n'est pas mesuré : le profil fourni refuse DetectText.

Synthèse JSON · Temps par image CSV · Manifeste du corpus