{"id":"W4389519117","doi":"10.18653/v1/2023.emnlp-main.491","title":"Don’t Trust ChatGPT when your Question is not in English: A Study of Multilingual Abilities and Types of LLMs","year":2023,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":62,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada; Alberta Machine Intelligence Institute","keywords":"Variety (cybernetics); Computer science; Natural language processing; Artificial intelligence; Linguistics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009837916,0.0005269083,0.0006321197,0.001213733,0.0007747724,0.002148948,0.001093846,0.001116668,0.002132095],"category_scores_gemma":[0.1022288,0.0004749348,0.000471544,0.0009596175,0.001997626,0.006615174,0.002980608,0.002009735,0.0008427054],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007163177,"about_ca_system_score_gemma":0.0007727587,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003489786,"about_ca_topic_score_gemma":0.003428037,"domain_scores_codex":[0.9920844,0.00475315,0.0006168241,0.001296129,0.0008848685,0.0003645654],"domain_scores_gemma":[0.8463714,0.1275854,0.008513856,0.01097243,0.004254706,0.00230222],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00326318,0.001616311,0.5809063,0.001391296,0.000611813,0.002838646,0.1022397,0.01035867,0.02488637,0.00701993,0.005126543,0.2597413],"study_design_scores_gemma":[0.0003041702,0.003658043,0.6439286,0.0005380863,0.0007335966,0.005778635,0.06817988,0.191869,0.03085125,0.0315331,0.02199964,0.0006259478],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9919743,0.0001599359,0.00379225,0.0002718977,0.00001644923,0.0000597944,0.00014842,0.0001593538,0.003417581],"genre_scores_gemma":[0.996748,0.00008209649,0.002194165,0.0001354817,0.00001533733,0.0000402018,0.0002051965,0.00006749692,0.0005120477],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.009837916,"threshold_uncertainty_score":0.05202848,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04011867324513748,"score_gpt":0.2954704506340845,"score_spread":0.255351777388947,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}