{"id":"W4381512791","doi":"10.21203/rs.3.rs-3074040/v1","title":"Unpaired Document Image Denoising for OCR using BiLSTM enhanced CycleGAN","year":2023,"lang":"en","type":"preprint","venue":"Research Square","topic":"Handwritten Text Recognition Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Artificial intelligence; Ground truth; Discriminator; Optical character recognition; Pattern recognition (psychology); Feature (linguistics); Image (mathematics); Deep learning; Noise (video); Focus (optics); Feature extraction; Noise reduction; Historical document","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.004452779,0.000433636,0.0005639119,0.001445458,0.0006569305,0.001958355,0.002620994,0.000451046,0.00004269955],"category_scores_gemma":[0.0009520644,0.0004475178,0.0003901821,0.001126211,0.0002101555,0.0006718519,0.004839188,0.001403636,0.0001683001],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009445296,"about_ca_system_score_gemma":0.0009725092,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000461774,"about_ca_topic_score_gemma":0.00005836444,"domain_scores_codex":[0.993758,0.0007420199,0.0006815551,0.001652542,0.001752054,0.00141381],"domain_scores_gemma":[0.9949095,0.0009754283,0.0002307918,0.001894321,0.001654368,0.0003356323],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0002838097,0.0009882961,0.0002323717,0.01601937,0.0007707805,0.0008061496,0.008965827,0.0009220183,0.4532176,0.01869612,0.03817338,0.4609243],"study_design_scores_gemma":[0.0007504065,0.0003970668,0.0002367124,0.004441256,0.00002577686,0.00001447312,0.0003707664,0.06854048,0.6366265,0.2854789,0.001950422,0.001167255],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02588518,0.0001941205,0.9657147,0.001503517,0.000537573,0.003631031,0.00009325225,0.001950649,0.0004900026],"genre_scores_gemma":[0.5199343,0.0003260778,0.4749776,0.00008568206,0.0007132707,0.002208361,0.0001803847,0.0002080848,0.001366329],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.4940491,"threshold_uncertainty_score":0.9997976,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1399532917035627,"score_gpt":0.4447921253720211,"score_spread":0.3048388336684584,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}