{"id":"W4297231914","doi":"10.16995/dscn.8110","title":"Multilingual Research Projects: Non-Latin Script Challenges for Making Use of Standards, Authority Files, and Character Recognition","year":2022,"lang":"en","type":"article","venue":"Digital Studies / Le champ numérique","topic":"Digital Humanities and Scholarship","field":"Arts and Humanities","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Digitization; Computer science; Metadata; Newspaper; Natural language processing; Optical character recognition; Artificial intelligence; XML; Character (mathematics); Alphabet; Process (computing); Latin Americans; Information retrieval; Linguistics; World Wide Web; Telecommunications; Sociology; Media studies","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.07574437,0.000740843,0.001120582,0.006117772,0.007373674,0.02132999,0.004437433,0.003652622,0.01118996],"category_scores_gemma":[0.2246794,0.0009603977,0.0008657768,0.00852126,0.01128633,0.03113034,0.01475675,0.004220547,0.009537406],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00556029,"about_ca_system_score_gemma":0.01227,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01595728,"about_ca_topic_score_gemma":0.01134808,"domain_scores_codex":[0.8944684,0.06713408,0.008069476,0.01083099,0.01740357,0.002093591],"domain_scores_gemma":[0.7261363,0.1349024,0.01517899,0.06849312,0.04565359,0.009635521],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"qualitative","study_design_scores_codex":[0.0002594752,0.0002064373,0.01252484,0.001599125,0.00006420495,0.0006707748,0.0505463,0.002468678,0.00441531,0.1850541,0.0595917,0.6825991],"study_design_scores_gemma":[0.00005293599,0.0001458461,0.007024965,0.001138093,0.00004002168,0.001073782,0.04350192,0.01353671,0.009182882,0.2253118,0.6987712,0.0002199302],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1016108,0.007127459,0.5793793,0.09951197,0.002070681,0.001338521,0.004932123,0.01310858,0.1909205],"genre_scores_gemma":[0.4396643,0.003380114,0.4993395,0.00584194,0.0009752709,0.001575652,0.007083943,0.005522083,0.03661715],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.97867,"threshold_uncertainty_score":0.4005793,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3801832065527054,"score_gpt":0.366869400317127,"score_spread":0.01331380623557837,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}