{"id":"W6891549042","doi":"10.48448/y8zy-ce22","title":"WatClaimCheck: A new Dataset for Claim Entailment and Inference","year":2022,"lang":"en","type":"other","venue":"Underline Science Inc.","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Premise; Inference; Identification (biology); Task (project management); Logical consequence; Quality (philosophy)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002108069,0.002131971,0.0009876173,0.008716776,0.002023895,0.003318756,0.00428108,0.004738275,0.03351274],"category_scores_gemma":[0.01753096,0.0006866997,0.001976232,0.006181962,0.0008246507,0.004364186,0.00368879,0.003019541,0.02606607],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002531894,"about_ca_system_score_gemma":0.003886051,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02313084,"about_ca_topic_score_gemma":0.04908056,"domain_scores_codex":[0.9968351,0.0005181599,0.0005992182,0.0009210467,0.0009009729,0.0002255667],"domain_scores_gemma":[0.9922694,0.003108427,0.0007449511,0.001889388,0.001570579,0.0004171976],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.000227951,0.0002738591,0.004228966,0.00164631,0.0001103763,0.0005517114,0.0002491141,0.001817201,0.001469368,0.005948028,0.9498543,0.03362281],"study_design_scores_gemma":[0.0003418747,0.00009568519,0.01016399,0.0005418909,0.000107939,0.0008579305,0.0005279926,0.01586825,0.004130869,0.01031812,0.9569342,0.0001112018],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.00883821,0.001425532,0.006683515,0.001078981,0.0003419987,0.0003573628,0.965646,0.00539711,0.01023131],"genre_scores_gemma":[0.005770729,0.0001789757,0.008938889,0.000192098,0.00005232202,0.0003066309,0.9824734,0.0002410067,0.001845945],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.03351274,"threshold_uncertainty_score":0.1121113,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04992216363888007,"score_gpt":0.3634655141163872,"score_spread":0.3135433504775071,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}