{"id":"W6948254567","doi":"10.48448/378s-9t86","title":"Multiple Sources are Better Than One: Incorporating External Knowledge in Low-Resource Glossing","year":2024,"lang":"en","type":"other","venue":"Underline Science Inc.","topic":"Genomics and Phylogenetic Studies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Training set; State (computer science); Language model; Scarcity; Resource (disambiguation)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0003786244,0.0003124839,0.0002801359,0.000310566,0.0001307538,0.0001583412,0.0005079946,0.0002223225,0.00001951459],"category_scores_gemma":[0.00006383819,0.0002900267,0.00007563215,0.000315566,0.000660243,0.000001561188,0.00065169,0.0002271942,0.00006733244],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004399665,"about_ca_system_score_gemma":0.0002026238,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001400485,"about_ca_topic_score_gemma":0.002323405,"domain_scores_codex":[0.9981883,0.00003934532,0.0002896441,0.0008191467,0.0002375711,0.0004260233],"domain_scores_gemma":[0.9992157,0.00001560707,0.0002144578,0.0004052212,0.000051716,0.00009732236],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00004320289,0.0004637437,0.09635378,0.0007501056,0.0002229488,0.00006005693,0.001042645,0.0004557169,0.842703,0.0002245589,0.03258489,0.02509532],"study_design_scores_gemma":[0.003196819,0.000769159,0.0297715,0.008189345,0.0002419916,0.00008471429,0.004137263,0.008663674,0.113729,0.003591168,0.8226925,0.00493292],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8374367,0.03504154,0.001333472,0.0003787737,0.001233292,0.0006593154,0.0001638673,0.00006343612,0.1236896],"genre_scores_gemma":[0.9530839,0.00009367981,0.004842398,0.0002136445,0.00141579,0.00001998701,0.00002799238,0.0002270382,0.04007551],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7901076,"threshold_uncertainty_score":0.9999552,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01794667992785194,"score_gpt":0.264371835071692,"score_spread":0.2464251551438401,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}