{"id":"W2154127072","doi":"10.1109/cvprw.2003.10020","title":"Information Retrieval Based on OCR Errors in Scanned Documents","year":2003,"lang":"en","type":"article","venue":"","topic":"Handwritten Text Recognition Techniques","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal; École de Technologie Supérieure; Concordia University","funders":"","keywords":"Computer science; Optical character recognition; Information retrieval; Relevance (law); Lexicon; n-gram; Artificial intelligence; Document retrieval; Matching (statistics); Process (computing); Error detection and correction; Character (mathematics); Pattern recognition (psychology); Natural language processing; Image (mathematics); Language model; Algorithm","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004580106,0.00009222543,0.00008791523,0.0003494439,0.00003971148,0.0001262276,0.0002869937,0.00005970546,0.000182439],"category_scores_gemma":[0.0001557021,0.0000841439,0.0000311187,0.0006039558,0.00001360874,0.001328613,0.0000269833,0.0001009155,0.0002999102],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008825474,"about_ca_system_score_gemma":0.00006891457,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0000221047,"about_ca_topic_score_gemma":0.000006802954,"domain_scores_codex":[0.9990678,0.0000834688,0.0002422711,0.0001244401,0.0002921295,0.0001898985],"domain_scores_gemma":[0.9994843,0.00004381367,0.00005943483,0.0002906421,0.00006388185,0.00005791546],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0002893546,0.001333345,0.01564563,0.0001504935,0.00003438574,0.00006194507,0.00314687,0.0009887698,0.002030371,0.4720269,0.04735531,0.4569366],"study_design_scores_gemma":[0.004974686,0.001154876,0.009556348,0.0002544807,0.000005984499,0.00002026875,0.0002125711,0.1723617,0.7092602,0.04424933,0.0566926,0.001256865],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02709441,0.000002817906,0.7898042,0.0007863291,0.000188202,0.0004052968,0.000001535893,0.0005622102,0.181155],"genre_scores_gemma":[0.9426777,0.00000213966,0.05450609,0.002557533,0.000003812927,0.0000133253,0.00000530285,0.000003455267,0.0002305953],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9155833,"threshold_uncertainty_score":0.3854838,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01046746240552175,"score_gpt":0.2512258561948089,"score_spread":0.2407583937892871,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}