{"id":"W7114892917","doi":"10.21979/n9/hoaful","title":"Replication Data for: Black Swan: Abductive and Defeasible Video Reasoning in Unpredictable Events","year":2025,"lang":"","type":"dataset","venue":"DR-NTU (Data)","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Defeasible estate; Abductive reasoning; Replication (statistics); Benchmark (surveying); Black box; Defeasible reasoning; Model-based reasoning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001622142,0.004063627,0.001384536,0.002991749,0.001327075,0.002186122,0.004422122,0.004675696,0.04556975],"category_scores_gemma":[0.01298628,0.0006239699,0.002117985,0.003198007,0.0008228814,0.00223446,0.002262785,0.00250059,0.04702483],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002643754,"about_ca_system_score_gemma":0.002305494,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.05155223,"about_ca_topic_score_gemma":0.1001536,"domain_scores_codex":[0.9978985,0.0005185467,0.0001850439,0.0005450962,0.0006144025,0.0002384051],"domain_scores_gemma":[0.9949385,0.001941199,0.0003189273,0.001253455,0.001115517,0.0004323748],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.000196196,0.0001159478,0.001282393,0.0008104221,0.00006011821,0.00006222178,0.0000416917,0.00150459,0.0002286057,0.000466291,0.9862439,0.008987456],"study_design_scores_gemma":[0.001034183,0.0002168137,0.01209657,0.0007958381,0.0001193939,0.0004233331,0.0005078125,0.02261,0.002945045,0.005456808,0.9536599,0.0001343876],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.002920364,0.0008514954,0.0006901041,0.0006718894,0.0001981895,0.0001252983,0.9876904,0.003085599,0.003766596],"genre_scores_gemma":[0.003864728,0.0001015577,0.001500048,0.0001357841,0.00002427107,0.0001328358,0.9929213,0.00009684153,0.001222662],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.05155223,"threshold_uncertainty_score":0.152446,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08676146071113301,"score_gpt":0.3769051824951303,"score_spread":0.2901437217839973,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}