{"id":"W4416416033","doi":"10.1016/j.jdent.2025.106245","title":"Accuracy of LLMs to retrieve numeric data for meta-analysis in dentistry","year":2025,"lang":"en","type":"article","venue":"Journal of Dentistry","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Limit (mathematics); Outcome (game theory); Risk assessment; MEDLINE","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","open_science","insufficient_payload"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.07962712,0.0002471663,0.007169363,0.001732749,0.00005727766,0.000621406,0.005587826,0.0001067465,0.005203149],"category_scores_gemma":[0.0792905,0.0001306081,0.006309935,0.00710194,0.00003702123,0.0005665334,0.0004802105,0.0002276327,0.0001078342],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004688302,"about_ca_system_score_gemma":0.0002326333,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001888679,"about_ca_topic_score_gemma":0.000118324,"domain_scores_codex":[0.978591,0.002581965,0.01384172,0.0007221898,0.00402295,0.0002401249],"domain_scores_gemma":[0.9730861,0.007157043,0.01207482,0.005297326,0.002209035,0.0001756578],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"meta_analysis","study_design_scores_codex":[0.0001540075,0.0005530919,0.1002484,0.0004503323,0.2499889,0.0002681326,0.0002221656,0.002146435,0.001260111,0.0009185,0.630571,0.01321891],"study_design_scores_gemma":[0.001613413,0.0001897354,0.1235544,0.000150812,0.5973852,0.0003644252,0.00277965,0.007370073,0.001510058,0.01121664,0.2531866,0.0006790558],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2685227,0.01652844,0.7082355,0.002488222,0.001664722,0.0009474972,0.0006523018,0.00000226586,0.0009583749],"genre_scores_gemma":[0.9577397,0.00005457809,0.02927148,0.0002719789,0.00006702895,0.00001501299,0.00001886352,0.000008772479,0.01255258],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.689217,"threshold_uncertainty_score":0.9997924,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8249960213679443,"score_gpt":0.6056581661013204,"score_spread":0.2193378552666239,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}