{"id":"W4409164491","doi":"10.1016/j.eswa.2025.127421","title":"How do LLMs perform on Turkish? A multi-faceted multi-prompt evaluation","year":2025,"lang":"en","type":"article","venue":"Expert Systems with Applications","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":false,"ca_institutions":"Toronto Zoo","funders":"Boğaziçi Üniversitesi","keywords":"Turkish; Computer science; Business; Risk analysis (engineering)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00043355,0.0002506372,0.0002352652,0.0002701486,0.0003839613,0.0006921428,0.001058446,0.000140267,0.000003409033],"category_scores_gemma":[0.00006674748,0.000186973,0.0000483015,0.0009717634,0.00005795243,0.0004585278,0.0001326386,0.0002305763,0.00002685845],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002781963,"about_ca_system_score_gemma":0.0001914404,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001104718,"about_ca_topic_score_gemma":0.00002177484,"domain_scores_codex":[0.9981332,0.00009835054,0.0002602244,0.0007155578,0.0005053109,0.0002873407],"domain_scores_gemma":[0.9979022,0.00007390659,0.0001853319,0.001250045,0.0005036283,0.00008490299],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007343142,0.001823241,0.000921823,0.0005376214,0.0002960892,0.00001120578,0.008562112,0.0004248082,0.04829965,0.4951015,0.0124742,0.4314743],"study_design_scores_gemma":[0.002681158,0.0001928422,0.000515894,0.0008848666,0.00004246777,0.00003945627,0.001030079,0.9259556,0.03140688,0.00167544,0.03464698,0.0009283565],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0006926651,0.005551864,0.9875053,0.001749286,0.0001628648,0.002839221,0.000005771317,0.001037172,0.0004558378],"genre_scores_gemma":[0.6570124,0.00001160428,0.3350546,0.0002022816,0.00006674029,0.006408329,0.00001788486,0.00001620691,0.001209958],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9255308,"threshold_uncertainty_score":0.7624536,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02679430898198465,"score_gpt":0.3229170655409644,"score_spread":0.2961227565589797,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}