{"id":"W6947655074","doi":"10.48448/7z21-dr51","title":"Don’t Trust ChatGPT when your Question is not in English: A Study of Multilingual Abilities and Types of LLMs","year":2023,"lang":"en","type":"other","venue":"Open MIND","topic":"Biomedical Text Mining and Ontologies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia; University of Alberta","funders":"","keywords":"Variety (cybernetics); Generalization; Natural language; Natural (archaeology); Phenomenon; Variation (astronomy)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01012275,0.0005790452,0.0005393511,0.001652656,0.000770263,0.002365892,0.001231042,0.0009331675,0.003418993],"category_scores_gemma":[0.09629865,0.0003470198,0.000460627,0.001338256,0.001956889,0.007780595,0.003592191,0.001661309,0.0009489806],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007360412,"about_ca_system_score_gemma":0.0008312025,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003496995,"about_ca_topic_score_gemma":0.003458554,"domain_scores_codex":[0.9921508,0.004595671,0.0005747625,0.001356117,0.000989368,0.0003332996],"domain_scores_gemma":[0.8672468,0.1096098,0.006991022,0.01009425,0.00418891,0.001869213],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.003066486,0.001555393,0.483888,0.001723713,0.0007047645,0.003061127,0.07448362,0.01217674,0.01885853,0.01677734,0.007232718,0.3764716],"study_design_scores_gemma":[0.0002896003,0.00245852,0.4407867,0.0006685368,0.0008581334,0.007091552,0.06485087,0.3168075,0.03873601,0.08653115,0.04030529,0.0006161552],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9764846,0.0002443833,0.01093746,0.0005006296,0.00002815248,0.00009568343,0.0003942335,0.0004329123,0.01088194],"genre_scores_gemma":[0.9936412,0.0001074978,0.004329781,0.0001884469,0.00001605983,0.00004125546,0.0004262861,0.000126559,0.00112295],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01012275,"threshold_uncertainty_score":0.05353487,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04203779765758684,"score_gpt":0.3432920720230085,"score_spread":0.3012542743654217,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}