Mesures réelles sur les mêmes fichiers, dans le même ordre. Les configurations s'exécutent successivement, sans GPU.
| Configuration | Images | Total | Moyenne | Médiane | P95 | P99 | Images/s | Erreurs |
|---|
PP-OCRv6 small est le candidat principal des premiers essais de qualité. La vitesse ne mesure pas la qualité de transcription. Un texte vide peut être correct.
Durées effectivement mesurées, sans extrapolation au corpus complet. Les conditions CPU et le détecteur peuvent différer des lots complets.
| Configuration | Images / cible | Total mesuré | Moyenne | P95 | Cœurs | Détecteur |
|---|
| Configuration | Cœurs | Détecteur | Initialisation | Échauffement · 3 images | Mur du lot |
|---|
L'OCR chronométré inclut le décodage du PNG, la détection, l'orientation et la
reconnaissance. RapidOCR garde ses modèles chargés pendant le lot. Tesseract est
appelé par son CLI pour chaque image : lancement du processus et chargement de
fra+eng sont inclus dans chaque durée.
Hors chronométrage OCR : lectures MySQL, téléchargement S3, conversion initiale en RGB, écriture des résultats, chargement initial de RapidOCR et trois images d'échauffement. Les PNG gardent la résolution d'origine ; transparence sur blanc, orientation EXIF appliquée et première frame uniquement pour les animations.
Une passe par moteur ; les lots interrompus sont signalés. Les percentiles utilisent une interpolation linéaire. Le total additionne les durées mesurées des images ; le débit vaut nombre d'images divisé par ce total. Le mur du lot inclut aussi les checkpoints. Ces mesures portent sur ce poste et ce corpus équilibré, sans extrapolation au trafic réel ni intervalle de confiance entre plusieurs campagnes.
TikTok : images associées à des Ads vidéo, aucune vidéo complète traitée. Rekognition n'est pas mesuré : le profil fourni refuse DetectText.