{"id":"W7162040362","doi":"10.36829/63cts.v12i2.1785","title":"Improving the Large Language Models (LMMs) Systems for Underrepresent Languages","year":2025,"lang":"","type":"article","venue":"Ciencia Tecnologí­a y Salud","topic":"Language and cultural evolution","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Scale AI","keywords":"Generative grammar; Indigenous; Knowledge base; Computational linguistics; Indigenous language; The Internet","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts"],"consensus_categories":[],"category_scores_codex":[0.002158921,0.000407225,0.0004855305,0.0001691227,0.002584447,0.000553886,0.001521423,0.0005318993,0.0001043322],"category_scores_gemma":[0.001131294,0.0002703493,0.0003689899,0.001272665,0.0006394794,0.0006604376,0.0004523278,0.0004704125,0.00005966887],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005255483,"about_ca_system_score_gemma":0.0006572944,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007702323,"about_ca_topic_score_gemma":0.002837965,"domain_scores_codex":[0.9959482,0.0004717458,0.0006233494,0.0008978461,0.0006580652,0.001400816],"domain_scores_gemma":[0.9978247,0.0004810447,0.0003655115,0.0008686908,0.0003147365,0.0001453185],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","study_design_scores_codex":[0.0001658432,0.0007399371,0.0007892795,0.00088361,0.0005835366,0.00006914239,0.166628,0.002171543,0.02730594,0.6535386,0.06337283,0.08375168],"study_design_scores_gemma":[0.001712371,0.0001919754,0.000845105,0.0003539819,0.000514298,0.00001049323,0.818559,0.1308635,0.001634494,0.005939815,0.03843132,0.0009437341],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4416101,0.2625239,0.1227648,0.0150049,0.01050931,0.01143087,0.0007042885,0.001537765,0.133914],"genre_scores_gemma":[0.9724342,0.0005988616,0.0001044024,0.0008379105,0.0009098472,0.0003133837,0.00003255165,0.00002429339,0.02474455],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.6519309,"threshold_uncertainty_score":0.9999748,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02246782002541666,"score_gpt":0.3160752349372846,"score_spread":0.293607414911868,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}