{"id":"W2154127072","doi":"10.1109/cvprw.2003.10020","title":"Information Retrieval Based on OCR Errors in Scanned Documents","year":2003,"lang":"en","type":"article","venue":"","topic":"Handwritten Text Recognition Techniques","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal; École de Technologie Supérieure; Concordia University","funders":"","keywords":"Computer science; Optical character recognition; Information retrieval; Relevance (law); Lexicon; n-gram; Artificial intelligence; Document retrieval; Matching (statistics); Process (computing); Error detection and correction; Character (mathematics); Pattern recognition (psychology); Natural language processing; Image (mathematics); Language model; Algorithm","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001274223,0.0008685879,0.001310516,0.009091715,0.000701861,0.001713392,0.0007718171,0.001019239,0.002973911],"category_scores_gemma":[0.01223866,0.0002925388,0.0004494333,0.005218801,0.0007459827,0.002874476,0.0008708843,0.0004606046,0.002443912],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009424345,"about_ca_system_score_gemma":0.0006814006,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002600786,"about_ca_topic_score_gemma":0.002677002,"domain_scores_codex":[0.9967661,0.0005019121,0.0003584135,0.0003421317,0.00187072,0.000160672],"domain_scores_gemma":[0.9928663,0.002619815,0.001195273,0.001014977,0.002201082,0.0001024984],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007132007,0.0001336444,0.004985244,0.0007957611,0.000106592,0.001326236,0.0005502803,0.006046951,0.1832502,0.002742531,0.008080505,0.7912688],"study_design_scores_gemma":[0.0001752354,0.0009474788,0.04449103,0.0003827206,0.0004833225,0.01065248,0.001177202,0.2425908,0.6469683,0.01021311,0.04164513,0.0002732062],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5616007,0.01025015,0.3923636,0.001176867,0.0005624215,0.0008678487,0.00163692,0.01193309,0.01960834],"genre_scores_gemma":[0.6352713,0.003191917,0.3444326,0.0003484598,0.0002818111,0.000228563,0.001851135,0.0005476821,0.01384663],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.009091715,"threshold_uncertainty_score":0.00994873,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01046746240552175,"score_gpt":0.2512258561948089,"score_spread":0.2407583937892871,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}