{"id":"W2550742442","doi":"10.16995/dscn.315","title":"How to Do Lexical Quality Estimation of a Large OCRed Historical Finnish Newspaper Collection with Scarce Resources","year":2020,"lang":"en","type":"preprint","venue":"Digital Studies / Le champ numérique","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Newspaper; Usability; Computer science; Data collection; Quality (philosophy); Digital collections; Information retrieval; World Wide Web; Statistics; Mathematics; Sociology; Media studies","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0003783759,0.0004594951,0.0009039755,0.000179421,0.0002186537,0.0007417087,0.001071652,0.0002839723,6.335261e-7],"category_scores_gemma":[0.001374914,0.0003846109,0.000184575,0.000785362,0.0001152901,0.0006360239,0.002630907,0.0006471593,0.000001924747],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007394573,"about_ca_system_score_gemma":0.0002214899,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001904183,"about_ca_topic_score_gemma":0.0001206957,"domain_scores_codex":[0.9971465,0.0001522732,0.000528738,0.001075707,0.0007161971,0.000380567],"domain_scores_gemma":[0.9978631,0.0002201253,0.0004987734,0.0007007292,0.0005485099,0.0001687268],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001622092,0.001676657,0.002289274,0.005308889,0.001404803,0.000257731,0.8457609,0.0008529643,0.001233035,0.008120587,0.05654172,0.07493136],"study_design_scores_gemma":[0.006088833,0.007797604,0.003670863,0.008731771,0.00001695953,0.0002554975,0.1760772,0.02242522,0.05322274,0.6227736,0.0881732,0.01076658],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0805686,0.004161427,0.8901147,0.02254024,0.0002652582,0.0008404456,0.00005949023,0.0009027753,0.0005471272],"genre_scores_gemma":[0.9497471,0.00004452772,0.04893476,0.0002863026,0.0001435155,0.0001918887,0.00002911153,0.00003430462,0.0005885013],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8691785,"threshold_uncertainty_score":0.9998606,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03329315508436567,"score_gpt":0.3027029905237361,"score_spread":0.2694098354393705,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}