Conception d'un système de reconnaissance optique de caractères imprimés et manuscrits sur formulaires fédéraux et documents historiques
Notice bibliographique
Résumé
« La préservation, la retranscription et l'accessibilité des documents manuscrits représentent un enjeu coûteux et complexe pour le gouvernement du Canada. De plus, les données pouvant être de nature confidentielle, l'utilisation de solutions privées représente un risque pour l'intégrité de l'information. Ce projet de recherche vise ainsi à développer un système de reconnaissance optique des caractères (OCR) sur des formulaires structurés puis de quantifier le taux d'exactitude et le temps de traitement requis afin d'établir une référence pour de futurs développements. Le taux d'exactitude visé doit être supérieur à 85% en comparaison à un opérateur humain et doit traiter un document de quinze cases en moins d'une minute pour être économiquement viable. Le projet doit aussi permettre de déterminer des pistes de solutions en vue de développer une solution plus complexe pour des documents non-structurés de nature historique. Afin d'atteindre ces objectifs, les principales étapes d'un système de reconnaissance de caractères sont étudiées et décomposées : le prétraitement, la segmentation, l'extraction des caractéristiques, la classification d'images et le post-traitement. Des solutions telles que la méthode ORB, la détection de contours, la transformée en cosinus discrète (DCT), la transformée en ondelettes discrète (DWT), la transformée de Hough et 190 réseaux de neurones différents sont notamment utilisés afin de détecter la position du texte dans l'image, d'extraire les caractéristiques et réaliser la classification des caractères. Sur un formulaire structuré avec une écriture typographique, le taux d'exactitude moyen après post-traitement est de 91,99% et il faut en moyenne 4,02 s pour traiter une case. Pour une écriture manuscrite, le taux d'exactitude après post-traitement est de 94,27% et il faut en moyenne 5,90 s pour traiter une case atteignant ainsi les objectifs fixés en termes de taux d'exactitude. Des améliorations restent cependant à apporter, notamment au niveau de l'écriture typographique, du seuillage ainsi que la segmentation de caractères collés pour améliorer l'exactitude. Au niveau du temps de traitement, la méthode proposée à l'aide de fenêtrage ainsi que le dictionnaire pour les prénoms sont des avenues moins prometteuses. Au niveau des documents historiques non-structurés, ceux-ci ont seulement été abordés. Toutefois, les résultats obtenus pour les formulaires structurés permettent d'établir que les principaux défis se trouvent au niveau de la détection du texte, la correction de l'alignement et de l'inclinaison ainsi que dans la segmentation de l'écriture cursive. Une solution à base de réseau de propositions régionales (RPN), de réseau de neurones convolutifs (CNN) et de réseaux de neurones récurrents (RNN) est suggérée afin de pallier certaines faiblesses observées. -- Mot(s) clé(s) en français : Intelligence artificielle, reconnaissance de caractères manuscrits, HCR, documents historiques, réseaux de neurones, OCR, reconnaissance optique de caractères. »-- « The preservation, transcription, and accessibility of handwritten documents represent a costly and complex challenge for the government of Canada. Additionally, as the data may be of a confidential nature, the use of a private solution poses a risk to the integrity of the information. Therefore, this research project aims to develop an optical character recognition (OCR) system for structured forms and to quantify the accuracy rate and processing time required to establish a benchmark for future development. The targeted accuracy rate should exceed 85% compared to a human operator and should process a fifteen-box document in less than a minute to be economically viable. The project should also identify potential solutions for developing a more complex solution for unstructured documents of a historical nature. To achieve these objectives, the main steps of a character recognition system are studied and broken down: preprocessing, segmentation, feature extraction, image classification, and post-processing. Solutions such as the ORB method, contour detection, discrete cosine transform (DCT), discrete wavelet transform (DWT), Hough transform, and 190 different neural networks are notably used to detect the position of text in the image, extract features, and perform character classification. On a structured form with typewritten text, the average accuracy rate after post-processing is 91.99%, and it takes an average of 4.02 seconds to process a box. For handwritten text, the accuracy rate after post-processing is 94.27%, and it takes an average of 5.90 seconds to process a box, thus meeting the set accuracy objectives. However, improvements are still needed, particularly in terms of typewritten text, thresholding, and segmenting stuck characters to enhance accuracy. Regarding processing time, the proposed method using windowing and a dictionary for first names are less promising avenues. Regarding unstructured historical documents, they have only been addressed. However, the results obtained for structured forms indicate that the main challenges lie in text detection, alignment, and tilt correction, as well as in the segmentation of cursive writing. A solution based on regional proposal networks (RPN), convolutional neural networks (CNN), and recurrent neural networks (RNN) is suggested to address some of the observed weaknesses. -- Mot(s) clé(s) en anglais : Artificial intelligence, Handwritten character recognition, HCR, Historical documents, Neural network, OCR, Optical character recognition. »--
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,004 | 0,006 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,002 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,001 |
| Communication savante | 0,005 | 0,004 |
| Science ouverte | 0,002 | 0,002 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,011 | 0,003 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».