{"id":"W4200356778","doi":"10.16995/dscn.8094","title":"Advances and Limitations in Open Source Arabic-Script OCR: A Case Study","year":2021,"lang":"en","type":"article","venue":"Digital Studies / Le champ numérique","topic":"Handwritten Text Recognition Techniques","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Endowment for the Humanities","keywords":"Typeface; Arabic; Open source; Humanities; Natural language processing; Artificial intelligence; Computer science; Linguistics; Art; Philosophy; Programming language; Software","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02370293,0.0008506792,0.0006146914,0.003765371,0.00156087,0.00514813,0.002615518,0.00191152,0.001774289],"category_scores_gemma":[0.09538493,0.0005476082,0.0007697355,0.004550935,0.002437027,0.004987454,0.002047902,0.001512518,0.001267994],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002622124,"about_ca_system_score_gemma":0.001659924,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01505624,"about_ca_topic_score_gemma":0.01411781,"domain_scores_codex":[0.9716471,0.009980594,0.003156134,0.00288141,0.01166753,0.0006671994],"domain_scores_gemma":[0.8569185,0.09333232,0.007312282,0.01575337,0.02592156,0.0007620161],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"qualitative","study_design_scores_codex":[0.0004545104,0.0002167129,0.0736263,0.0023876,0.0001206288,0.004218707,0.0339719,0.01664192,0.01388036,0.009266774,0.006009521,0.839205],"study_design_scores_gemma":[0.00006259149,0.001286164,0.1526156,0.003220776,0.0005320719,0.02549764,0.05259823,0.1657614,0.1756645,0.02094572,0.4012115,0.0006038048],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8456404,0.008078434,0.100108,0.005302255,0.0002686076,0.00036306,0.001437375,0.002169832,0.03663201],"genre_scores_gemma":[0.9079629,0.002332396,0.08322071,0.0004102598,0.0001157686,0.000118716,0.001030763,0.0006082248,0.004200239],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02370293,"threshold_uncertainty_score":0.1253546,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07025261429829413,"score_gpt":0.310846118016601,"score_spread":0.2405935037183069,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}