{"id":"W4396828139","doi":"10.1016/j.jclinepi.2024.111392","title":"High certainty evidence is stable and trustworthy, whereas evidence of moderate or lower certainty may be equally prone to being unstable","year":2024,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Impact; McMaster University; University of Toronto","funders":"Agency for Healthcare Research and Quality","keywords":"Certainty; Trustworthiness; Best evidence; Medicine; Psychology; Social psychology; Philosophy; Intensive care medicine; Epistemology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"design_other","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"medium","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3585264,0.00265006,0.01331223,0.02121877,0.002734684,0.01659948,0.004743155,0.01152311,0.006734883],"category_scores_gemma":[0.735595,0.003137282,0.01507176,0.01625171,0.01250996,0.01491456,0.008922184,0.008209038,0.001600525],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005710944,"about_ca_system_score_gemma":0.01159505,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003364356,"about_ca_topic_score_gemma":0.004140508,"domain_scores_codex":[0.4581886,0.2547424,0.1781745,0.03350829,0.07214297,0.003243364],"domain_scores_gemma":[0.1812367,0.6076413,0.1299341,0.0396332,0.0388384,0.002716294],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"observational","study_design_scores_codex":[0.006086478,0.0003558375,0.0881787,0.4000306,0.1547508,0.002106914,0.007729256,0.003663759,0.002658862,0.05916242,0.01983318,0.2554431],"study_design_scores_gemma":[0.005654322,0.001775889,0.05552746,0.3826301,0.1201384,0.002994976,0.004059738,0.005707921,0.003683256,0.3098537,0.1066765,0.001297847],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"review","genre_gemma":"empirical","genre_scores_codex":[0.05788381,0.6079095,0.1845715,0.06479012,0.01325511,0.01473138,0.01086436,0.0007295369,0.04526455],"genre_scores_gemma":[0.705131,0.09494697,0.1455891,0.02671557,0.006716667,0.01503746,0.003728581,0.0003833465,0.001751307],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.6414737,"threshold_uncertainty_score":0.7910512,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8821027366395712,"score_gpt":0.6445481323345401,"score_spread":0.2375546043050311,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}