MétaCan
Menu
Retour à la cohorte
Enregistrement W7027498689

Conception d'un système de reconnaissance optique de caractères imprimés et manuscrits sur formulaires fédéraux et documents historiques

2024· other· fr· W7027498689 sur OpenAlexaboutno aff

Notice bibliographique

RevueSémaphore (Université du Québec à Rimouski) · 2024
Typeother
Languefr
Domaine
Thématique
Établissements canadiensnon disponible
Organismes subventionnairesnon disponible
Mots-clésFilter (signal processing)Context (archaeology)Subject (documents)Paraphernalia
DOInon disponible

Résumé

récupéré en direct d'OpenAlex

« La préservation, la retranscription et l'accessibilité des documents manuscrits représentent un enjeu coûteux et complexe pour le gouvernement du Canada. De plus, les données pouvant être de nature confidentielle, l'utilisation de solutions privées représente un risque pour l'intégrité de l'information. Ce projet de recherche vise ainsi à développer un système de reconnaissance optique des caractères (OCR) sur des formulaires structurés puis de quantifier le taux d'exactitude et le temps de traitement requis afin d'établir une référence pour de futurs développements. Le taux d'exactitude visé doit être supérieur à 85% en comparaison à un opérateur humain et doit traiter un document de quinze cases en moins d'une minute pour être économiquement viable. Le projet doit aussi permettre de déterminer des pistes de solutions en vue de développer une solution plus complexe pour des documents non-structurés de nature historique. Afin d'atteindre ces objectifs, les principales étapes d'un système de reconnaissance de caractères sont étudiées et décomposées : le prétraitement, la segmentation, l'extraction des caractéristiques, la classification d'images et le post-traitement. Des solutions telles que la méthode ORB, la détection de contours, la transformée en cosinus discrète (DCT), la transformée en ondelettes discrète (DWT), la transformée de Hough et 190 réseaux de neurones différents sont notamment utilisés afin de détecter la position du texte dans l'image, d'extraire les caractéristiques et réaliser la classification des caractères. Sur un formulaire structuré avec une écriture typographique, le taux d'exactitude moyen après post-traitement est de 91,99% et il faut en moyenne 4,02 s pour traiter une case. Pour une écriture manuscrite, le taux d'exactitude après post-traitement est de 94,27% et il faut en moyenne 5,90 s pour traiter une case atteignant ainsi les objectifs fixés en termes de taux d'exactitude. Des améliorations restent cependant à apporter, notamment au niveau de l'écriture typographique, du seuillage ainsi que la segmentation de caractères collés pour améliorer l'exactitude. Au niveau du temps de traitement, la méthode proposée à l'aide de fenêtrage ainsi que le dictionnaire pour les prénoms sont des avenues moins prometteuses. Au niveau des documents historiques non-structurés, ceux-ci ont seulement été abordés. Toutefois, les résultats obtenus pour les formulaires structurés permettent d'établir que les principaux défis se trouvent au niveau de la détection du texte, la correction de l'alignement et de l'inclinaison ainsi que dans la segmentation de l'écriture cursive. Une solution à base de réseau de propositions régionales (RPN), de réseau de neurones convolutifs (CNN) et de réseaux de neurones récurrents (RNN) est suggérée afin de pallier certaines faiblesses observées. -- Mot(s) clé(s) en français : Intelligence artificielle, reconnaissance de caractères manuscrits, HCR, documents historiques, réseaux de neurones, OCR, reconnaissance optique de caractères. »-- « The preservation, transcription, and accessibility of handwritten documents represent a costly and complex challenge for the government of Canada. Additionally, as the data may be of a confidential nature, the use of a private solution poses a risk to the integrity of the information. Therefore, this research project aims to develop an optical character recognition (OCR) system for structured forms and to quantify the accuracy rate and processing time required to establish a benchmark for future development. The targeted accuracy rate should exceed 85% compared to a human operator and should process a fifteen-box document in less than a minute to be economically viable. The project should also identify potential solutions for developing a more complex solution for unstructured documents of a historical nature. To achieve these objectives, the main steps of a character recognition system are studied and broken down: preprocessing, segmentation, feature extraction, image classification, and post-processing. Solutions such as the ORB method, contour detection, discrete cosine transform (DCT), discrete wavelet transform (DWT), Hough transform, and 190 different neural networks are notably used to detect the position of text in the image, extract features, and perform character classification. On a structured form with typewritten text, the average accuracy rate after post-processing is 91.99%, and it takes an average of 4.02 seconds to process a box. For handwritten text, the accuracy rate after post-processing is 94.27%, and it takes an average of 5.90 seconds to process a box, thus meeting the set accuracy objectives. However, improvements are still needed, particularly in terms of typewritten text, thresholding, and segmenting stuck characters to enhance accuracy. Regarding processing time, the proposed method using windowing and a dictionary for first names are less promising avenues. Regarding unstructured historical documents, they have only been addressed. However, the results obtained for structured forms indicate that the main challenges lie in text detection, alignment, and tilt correction, as well as in the segmentation of cursive writing. A solution based on regional proposal networks (RPN), convolutional neural networks (CNN), and recurrent neural networks (RNN) is suggested to address some of the observed weaknesses. -- Mot(s) clé(s) en anglais : Artificial intelligence, Handwritten character recognition, HCR, Historical documents, Neural network, OCR, Optical character recognition. »--

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,004
score de la tête « metaresearch » (Gemma)0,006
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesaucune
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Simulation ou modélisation · Signal consensuel: aucune
GenreSignal candidat: Méthodes · Signal consensuel: Méthodes
Score de désaccord entre enseignants0,012
Score d'incertitude au seuil0,037

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,0040,006
Méta-épidémiologie (sens strict)0,0010,001
Méta-épidémiologie (sens large)0,0010,001
Bibliométrie0,0020,001
Études des sciences et des technologies0,0010,001
Communication savante0,0050,004
Science ouverte0,0020,002
Intégrité de la recherche0,0010,001
Charge utile insuffisante (le modèle a refusé de juger)0,0110,003

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,012
Tête enseignante GPT0,231
Écart entre enseignants0,219 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.

Les modèles n’ont appliqué aucune catégorie : rien dans la taxonomie ne correspondait à ce travail.
Devis d'étudeSimulation ou modélisation
Domainenon disponible
GenreMéthodes

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2024
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueSémaphore (Université du Québec à Rimouski)Travaux en français237 207