{"id":"W7125609352","doi":"10.1109/icsai68704.2025.11345826","title":"Evaluating Zero-Shot and Few-Shot Learning on the Turkish Massive Multitask Language Understanding Dataset","year":2025,"lang":"","type":"article","venue":"","topic":"Domain Adaptation and Few-Shot Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Calgary; Dalhousie University","funders":"","keywords":"Turkish; Task (project management); Multi-task learning; Language acquisition; Task analysis; Feature (linguistics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003466993,0.00313967,0.002117022,0.002190968,0.001038414,0.001536149,0.00234195,0.003082828,0.00275053],"category_scores_gemma":[0.008298196,0.0003849708,0.001663951,0.001382675,0.0007713109,0.00396946,0.002327086,0.002368282,0.002440271],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001213361,"about_ca_system_score_gemma":0.001623765,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01732332,"about_ca_topic_score_gemma":0.02621793,"domain_scores_codex":[0.9973846,0.0007927079,0.0001552087,0.001052373,0.0003292657,0.000285966],"domain_scores_gemma":[0.9963292,0.002027326,0.0001141554,0.0006362998,0.0005695064,0.0003234843],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003609204,0.003293685,0.01138206,0.001925666,0.001676153,0.0007050824,0.0006427987,0.1075732,0.02464722,0.001839097,0.091948,0.7507579],"study_design_scores_gemma":[0.0003804968,0.001816322,0.01635499,0.0001808933,0.0006748243,0.0007620768,0.001416108,0.9291136,0.02706424,0.005006473,0.01703244,0.0001975637],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8265859,0.01787191,0.1019168,0.001020615,0.001426564,0.0005774806,0.01346139,0.02602898,0.01111039],"genre_scores_gemma":[0.8227986,0.001789971,0.06995296,0.0008081228,0.000261102,0.0003411543,0.09101968,0.00102401,0.01200457],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01732332,"threshold_uncertainty_score":0.03444499,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1710522026815548,"score_gpt":0.3854136519028957,"score_spread":0.2143614492213408,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}