{"id":"W4415034806","doi":"","title":"LIS at CheckThat! 2025: Multi-Stage Open-Source Large Language Models for Fact-Checking Numerical Claims","year":2025,"lang":"en","type":"article","venue":"HAL (Le Centre pour la Communication Scientifique Directe)","topic":"Software Engineering Research","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Windsor","funders":"","keywords":"Natural language; Field (mathematics); Identification (biology); Narrative; Government (linguistics); Context (archaeology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005301083,0.001944329,0.001122788,0.002076605,0.001663099,0.005874323,0.004627073,0.00362124,0.06379175],"category_scores_gemma":[0.03362006,0.002813094,0.00510824,0.001060476,0.002799713,0.01329401,0.007237039,0.005079635,0.01971454],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002902135,"about_ca_system_score_gemma":0.005217667,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01276848,"about_ca_topic_score_gemma":0.02049536,"domain_scores_codex":[0.994724,0.001617791,0.000411501,0.0009902837,0.001749839,0.0005065117],"domain_scores_gemma":[0.9763923,0.01324571,0.0009134552,0.0063763,0.002524743,0.0005474898],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00249684,0.0006572949,0.01017986,0.002072262,0.0004263951,0.001432176,0.002220788,0.1200689,0.01428965,0.4541016,0.2648135,0.1272407],"study_design_scores_gemma":[0.0003236027,0.0001574317,0.0008449902,0.0003281605,0.0001465041,0.000293249,0.0002830739,0.6524198,0.02307018,0.1846888,0.137244,0.0002001553],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01029582,0.0001210236,0.7213209,0.001455457,0.0004269213,0.0003458559,0.009965206,0.2430643,0.01300466],"genre_scores_gemma":[0.3532453,0.0002729057,0.514173,0.001031957,0.0002423375,0.0007392222,0.02660654,0.08257252,0.02111615],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.06379175,"threshold_uncertainty_score":0.2134047,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03497181897117677,"score_gpt":0.3040043904022577,"score_spread":0.2690325714310809,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}