{"id":"W7102430568","doi":"","title":"Global PIQA: Evaluating Commonsense Reasoning Across 100+ Languages and Cultures","year":2025,"lang":"","type":"article","venue":"ArXiv.org","topic":"Language and cultural evolution","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Fundação para a Ciência e a Tecnologia; University of Illinois at Urbana-Champaign; Adekunle Ajasin University; Universidade de Santiago de Compostela; Università degli Studi di Udine; Tartu Ülikool; Barcelona Supercomputing Center; Technion-Israel Institute of Technology; Háskóli Íslands; University of Jaffna; NED University of Engineering and Technology; University of Waterloo; Orta Doğu Teknik Üniversitesi; Università degli Studi di Torino; Università degli Studi di Trento; Pohang University of Science and Technology; King Abdullah University of Science and Technology; University of Engineering and Technology, Lahore; École Polytechnique Fédérale de Lausanne; Imperial College London; KT; Centre National de la Recherche Scientifique; Università degli Studi di Milano; Université de Montpellier; Univerzita Komenského v Bratislave; University of Hawai'i at Mānoa; Addis Ababa University; University of Hawai'i; Zayed University; Carnegie Mellon University; Georgia Institute of Technology; Fondazione Bruno Kessler; University of Moratuwa; Seoul National University; Aarhus Universitet; Cisco Systems; Texas State University; Universitas Indonesia; Universitetet i Oslo; City University of Hong Kong; Massachusetts Institute of Technology","keywords":"Commonsense reasoning; Cover (algebra); Benchmark (surveying); Diversity (politics); Citizen journalism; Commonsense knowledge","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts"],"consensus_categories":[],"category_scores_codex":[0.001133018,0.0003078338,0.0003616687,0.00002323783,0.002370187,0.0003408211,0.0003200987,0.0003189693,0.0002196478],"category_scores_gemma":[0.001520813,0.0002549658,0.000143594,0.0009011979,0.000614911,0.0004367466,0.0003225647,0.0002861807,0.00009828624],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002836329,"about_ca_system_score_gemma":0.000192556,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01304012,"about_ca_topic_score_gemma":0.01432263,"domain_scores_codex":[0.9972034,0.0005778864,0.000402895,0.0005877113,0.0004565074,0.0007716744],"domain_scores_gemma":[0.998913,0.0001667195,0.0002073425,0.0002926713,0.0002462099,0.0001740208],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00008367855,0.0000875741,0.8963639,0.00008459254,0.0001577452,0.00005298373,0.06486101,0.00002073808,0.00191703,0.003383203,0.006850828,0.0261367],"study_design_scores_gemma":[0.0008459456,0.0001014285,0.7792882,0.0004794009,0.0001936464,0.00001297052,0.2106009,0.0002338415,0.0002876435,0.0004021137,0.007124895,0.0004289951],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.95695,0.01754579,0.0000169364,0.002501323,0.0005612032,0.0003296191,0.00005220726,0.0001241689,0.02191875],"genre_scores_gemma":[0.9896511,0.0005732396,0.0001590404,0.0009125319,0.000488543,0.00001436705,0.0000199786,0.00000918874,0.008171989],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1457399,"threshold_uncertainty_score":0.9999903,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03714887467949434,"score_gpt":0.4313602788698926,"score_spread":0.3942114041903982,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}