{"id":"W7102430568","doi":"","title":"Global PIQA: Evaluating Commonsense Reasoning Across 100+ Languages and Cultures","year":2025,"lang":"","type":"article","venue":"ArXiv.org","topic":"Language and cultural evolution","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Fundação para a Ciência e a Tecnologia; University of Illinois at Urbana-Champaign; Adekunle Ajasin University; Universidade de Santiago de Compostela; Università degli Studi di Udine; Tartu Ülikool; Barcelona Supercomputing Center; Technion-Israel Institute of Technology; Háskóli Íslands; University of Jaffna; NED University of Engineering and Technology; University of Waterloo; Orta Doğu Teknik Üniversitesi; Università degli Studi di Torino; Università degli Studi di Trento; Pohang University of Science and Technology; King Abdullah University of Science and Technology; University of Engineering and Technology, Lahore; École Polytechnique Fédérale de Lausanne; Imperial College London; KT; Centre National de la Recherche Scientifique; Università degli Studi di Milano; Université de Montpellier; Univerzita Komenského v Bratislave; University of Hawai'i at Mānoa; Addis Ababa University; University of Hawai'i; Zayed University; Carnegie Mellon University; Georgia Institute of Technology; Fondazione Bruno Kessler; University of Moratuwa; Seoul National University; Aarhus Universitet; Cisco Systems; Texas State University; Universitas Indonesia; Universitetet i Oslo; City University of Hong Kong; Massachusetts Institute of Technology","keywords":"Commonsense reasoning; Cover (algebra); Benchmark (surveying); Diversity (politics); Citizen journalism; Commonsense knowledge","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0111801,0.002103522,0.0008726597,0.004462245,0.001486035,0.003280093,0.003164496,0.002193843,0.005919988],"category_scores_gemma":[0.04763538,0.0004459564,0.002003625,0.003200514,0.002260033,0.007162585,0.006145348,0.002477796,0.002347069],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002794729,"about_ca_system_score_gemma":0.002487793,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01648649,"about_ca_topic_score_gemma":0.02021179,"domain_scores_codex":[0.9882402,0.00642214,0.0009723279,0.001893576,0.002120045,0.0003516327],"domain_scores_gemma":[0.9683011,0.0218366,0.0009508268,0.004460135,0.003227925,0.001223493],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002097787,0.00209005,0.1007596,0.005189716,0.00227884,0.001479613,0.008846684,0.2044882,0.009469074,0.02561696,0.1259976,0.511686],"study_design_scores_gemma":[0.0009108372,0.001580577,0.03931128,0.001014098,0.0005740157,0.001661562,0.009497674,0.7409464,0.02185062,0.07970677,0.1026048,0.0003414908],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7502269,0.007643316,0.1156578,0.003390223,0.0007040816,0.001426915,0.03565674,0.02529027,0.06000372],"genre_scores_gemma":[0.8430114,0.0007307314,0.0958968,0.0008915261,0.0000879726,0.0006490743,0.05408265,0.001177207,0.003472696],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01648649,"threshold_uncertainty_score":0.05912673,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03714887467949434,"score_gpt":0.4313602788698926,"score_spread":0.3942114041903982,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}