{"id":"W4393823895","doi":"10.5281/zenodo.3932441","title":"SemEval-2020 Task 5: Modelling Causal Reasoning in Language: Detecting Counterfactuals","year":2020,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University; Queen's University","funders":"","keywords":"Counterfactual conditional; Computer science; Task (project management); SemEval; Causal reasoning; Natural language processing; Artificial intelligence; Linguistics; Psychology; Counterfactual thinking; Philosophy; Cognition; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003338418,0.006235627,0.001547073,0.002727751,0.00163269,0.00337559,0.005892839,0.005091087,0.03032065],"category_scores_gemma":[0.009591959,0.001016928,0.003748063,0.002124689,0.00107223,0.003409224,0.00325279,0.003703496,0.03399163],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00337828,"about_ca_system_score_gemma":0.003299796,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0270142,"about_ca_topic_score_gemma":0.06076585,"domain_scores_codex":[0.9974891,0.0008363956,0.0002205534,0.0007513277,0.0004832278,0.0002193788],"domain_scores_gemma":[0.9959118,0.002143738,0.0002257114,0.000836653,0.0005626893,0.0003193519],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0006743952,0.0004296842,0.002525527,0.002430964,0.0002177531,0.0003471811,0.0001778258,0.005114592,0.001465563,0.002610113,0.9567299,0.02727658],"study_design_scores_gemma":[0.003463252,0.0006197831,0.01629503,0.001307371,0.0004552811,0.001698166,0.001182412,0.1112003,0.01262879,0.02625765,0.8246062,0.0002857005],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.01695245,0.001931654,0.008746411,0.001442037,0.0005225582,0.0007377811,0.9359426,0.02278007,0.01094435],"genre_scores_gemma":[0.01055138,0.0001596272,0.0100932,0.000264852,0.00003925714,0.0005298769,0.9756564,0.0003597382,0.002345717],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.03032065,"threshold_uncertainty_score":0.1014327,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03623281979995987,"score_gpt":0.2593833261198226,"score_spread":0.2231505063198627,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}