{"id":"W4409164491","doi":"10.1016/j.eswa.2025.127421","title":"How do LLMs perform on Turkish? A multi-faceted multi-prompt evaluation","year":2025,"lang":"en","type":"article","venue":"Expert Systems with Applications","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":false,"ca_institutions":"Toronto Zoo","funders":"Boğaziçi Üniversitesi","keywords":"Turkish; Computer science; Business; Risk analysis (engineering)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00517498,0.001328745,0.001108879,0.001728953,0.001162773,0.001954598,0.001062201,0.001829806,0.006590028],"category_scores_gemma":[0.03417983,0.0002873682,0.0007857431,0.001324349,0.0005789503,0.004099123,0.002527821,0.001114724,0.005375652],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001210017,"about_ca_system_score_gemma":0.001326246,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006496789,"about_ca_topic_score_gemma":0.008302894,"domain_scores_codex":[0.9930776,0.00420296,0.0005945786,0.0006981787,0.000909845,0.0005168265],"domain_scores_gemma":[0.9774374,0.01265511,0.001165612,0.002125379,0.005479512,0.001136936],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.03406099,0.00657858,0.1462839,0.006515845,0.0009521603,0.004037867,0.02013944,0.04393933,0.060342,0.003712528,0.08889206,0.5845453],"study_design_scores_gemma":[0.002663963,0.01560108,0.3949032,0.001314749,0.001602571,0.003977785,0.04888048,0.2784905,0.1026673,0.008799523,0.1399808,0.001117991],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9752097,0.0006319517,0.00877607,0.0004720761,0.0001775415,0.0002942185,0.003555317,0.002574434,0.008308785],"genre_scores_gemma":[0.9771184,0.0001908079,0.01055953,0.0001649185,0.00003190436,0.0002574943,0.007774857,0.000432841,0.003469276],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.006590028,"threshold_uncertainty_score":0.02736825,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02679430898198465,"score_gpt":0.3229170655409644,"score_spread":0.2961227565589797,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}