{"id":"W4416961735","doi":"10.1109/pst65910.2025.11268820","title":"FactCellar: An Evidence-based Dataset for Automated Fact-Checking","year":2025,"lang":"","type":"article","venue":"","topic":"Misinformation and Its Impacts","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Metadata; Pipeline (software); Baseline (sea); Credibility; Domain (mathematical analysis); F1 score","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003002391,0.001148308,0.0006246265,0.01295882,0.001180566,0.002374989,0.002243474,0.003147844,0.01108866],"category_scores_gemma":[0.02441432,0.0003789,0.0008942125,0.008785327,0.0007096626,0.002687059,0.002825439,0.001586645,0.009280592],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001666851,"about_ca_system_score_gemma":0.003114339,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01384357,"about_ca_topic_score_gemma":0.02344533,"domain_scores_codex":[0.9964325,0.0005854105,0.0007626001,0.0006449075,0.001353504,0.0002210119],"domain_scores_gemma":[0.9781185,0.009376921,0.003212793,0.004392165,0.003885628,0.001014077],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005354667,0.0004410842,0.05051266,0.002940288,0.0002284174,0.001783613,0.000841646,0.005887977,0.003719902,0.01186744,0.8412806,0.07996088],"study_design_scores_gemma":[0.0002630439,0.0001256029,0.07028662,0.001172767,0.0001382976,0.001765455,0.001388729,0.01800735,0.00701728,0.01007525,0.8896001,0.0001595328],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.01937056,0.001040899,0.005518503,0.001042342,0.0001532111,0.000339834,0.961834,0.002698703,0.008002126],"genre_scores_gemma":[0.02234047,0.0003943985,0.01452038,0.0002306386,0.00005895095,0.000357276,0.9603171,0.0001641606,0.001616604],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.01384357,"threshold_uncertainty_score":0.03709531,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1408192365393426,"score_gpt":0.4416799559078214,"score_spread":0.3008607193684788,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}