{"id":"W4293863327","doi":"10.1109/siu55565.2022.9864878","title":"Neural Machine Translation Approaches for Post-OCR Text Processing","year":2022,"lang":"en","type":"article","venue":"2022 30th Signal Processing and Communications Applications Conference (SIU)","topic":"Handwritten Text Recognition Techniques","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"Stantec (Canada)","funders":"","keywords":"Automatic summarization; Computer science; Optical character recognition; Machine translation; Artificial intelligence; Natural language processing; Text recognition; Process (computing); Speech recognition; Document processing; Error detection and correction; Translation (biology); Intelligent word recognition; Pattern recognition (psychology); Information extraction; Character recognition; Image (mathematics); Intelligent character recognition","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006027432,0.0008449003,0.000492367,0.001108502,0.0005773266,0.0008757159,0.001052538,0.0009209276,0.00480552],"category_scores_gemma":[0.002158884,0.0001985277,0.0006189647,0.001390125,0.0003553145,0.001023789,0.0004271427,0.0009267948,0.003020458],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006781986,"about_ca_system_score_gemma":0.0006336377,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004505411,"about_ca_topic_score_gemma":0.00612882,"domain_scores_codex":[0.9995432,0.0001077351,0.00004408044,0.0001351147,0.0001308236,0.00003903448],"domain_scores_gemma":[0.9990861,0.0002693365,0.00009169282,0.0001292661,0.0004067031,0.00001676974],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001095817,0.000156498,0.0005463291,0.0002758028,0.00007353798,0.0001620709,0.00009922908,0.05319408,0.01801389,0.00538368,0.005459112,0.9165262],"study_design_scores_gemma":[0.00003322422,0.0001847624,0.001661705,0.00005595944,0.00007576852,0.0002969543,0.0001083615,0.940293,0.02625711,0.01312174,0.01787695,0.00003448814],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04907612,0.00781947,0.9226409,0.0008488937,0.0006253595,0.000194609,0.0004360561,0.004448371,0.01391024],"genre_scores_gemma":[0.4315716,0.004821625,0.527652,0.0004734622,0.0006146507,0.000327752,0.002013807,0.0004519041,0.0320732],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00480552,"threshold_uncertainty_score":0.01607609,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07876931332849635,"score_gpt":0.2935847599729343,"score_spread":0.214815446644438,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}