{"id":"W7130624835","doi":"","title":"WatClaimCheck: A new Dataset for Claim Entailment and Inference","year":2022,"lang":"","type":"other","venue":"Open MIND","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Premise; Inference; Identification (biology); Task (project management); Logical consequence; Quality (philosophy)","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002152399,0.002139509,0.00102013,0.008210617,0.002164088,0.003305599,0.00428295,0.00487529,0.03079424],"category_scores_gemma":[0.01708411,0.0006874566,0.001987682,0.00554812,0.0008668946,0.004399163,0.003770742,0.003162135,0.02351499],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002580729,"about_ca_system_score_gemma":0.003968325,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02216351,"about_ca_topic_score_gemma":0.04982775,"domain_scores_codex":[0.9967858,0.0005343095,0.0006001145,0.000939663,0.0009057389,0.0002345215],"domain_scores_gemma":[0.9921091,0.003197646,0.0008090954,0.001889308,0.001556528,0.0004383092],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002732161,0.0003114713,0.004334219,0.001925582,0.0001306268,0.0005688371,0.0002865845,0.001712881,0.001821407,0.00597924,0.9480426,0.03461327],"study_design_scores_gemma":[0.0003987836,0.0001195473,0.01161879,0.0006062753,0.0001271115,0.0009039806,0.0006203683,0.01670783,0.004865746,0.01057741,0.9533268,0.0001273882],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.009913773,0.001644006,0.006876969,0.001160958,0.0003862185,0.0003921672,0.9645038,0.005690591,0.009431575],"genre_scores_gemma":[0.006551847,0.0001944754,0.009724154,0.0002160635,0.00005984853,0.0003346327,0.9808998,0.0002418191,0.001777422],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.03079424,"threshold_uncertainty_score":0.103017,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1207315091918407,"score_gpt":0.4020383260047265,"score_spread":0.2813068168128858,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}