{"id":"W7114892917","doi":"10.21979/n9/hoaful","title":"Replication Data for: Black Swan: Abductive and Defeasible Video Reasoning in Unpredictable Events","year":2025,"lang":"","type":"dataset","venue":"DR-NTU (Data)","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Defeasible estate; Abductive reasoning; Replication (statistics); Benchmark (surveying); Black box; Defeasible reasoning; Model-based reasoning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","metaepi_narrow","open_science","research_integrity","insufficient_payload"],"consensus_categories":["metaepi_narrow","open_science","research_integrity"],"category_scores_codex":[0.01503579,0.002439762,0.003142639,0.002267474,0.001084785,0.0009849909,0.02498057,0.001891366,0.0002089768],"category_scores_gemma":[0.026597,0.003048222,0.0001664485,0.004696094,0.001060934,0.00965068,0.04154075,0.002906777,0.0008941362],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001532071,"about_ca_system_score_gemma":0.003579123,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004133936,"about_ca_topic_score_gemma":0.006511284,"domain_scores_codex":[0.9746954,0.001502402,0.003600288,0.01510517,0.002235246,0.002861527],"domain_scores_gemma":[0.9158124,0.001997669,0.003112741,0.07743892,0.0008322441,0.0008060327],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001855315,0.001135443,0.001834671,0.002600324,0.001185414,0.00004205061,0.0001453306,0.0001315954,0.00008579762,0.0003354693,0.98891,0.001738581],"study_design_scores_gemma":[0.005558952,0.000225423,0.0007349562,0.005803694,0.003031445,0.0000670901,0.0007016122,0.08298487,0.00004281261,0.001259945,0.8974252,0.002163975],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.0004352315,0.008169664,0.001346481,0.0006282585,0.001617201,0.007988964,0.979279,0.000247754,0.0002874837],"genre_scores_gemma":[0.000505298,0.01073658,0.007162816,0.0002173678,0.001151398,0.0005041329,0.9782478,0.000415444,0.001059121],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.09148479,"threshold_uncertainty_score":0.9998838,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08676146071113301,"score_gpt":0.3769051824951303,"score_spread":0.2901437217839973,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}