{"id":"W4414534865","doi":"10.2196/72412","title":"Using Large Language Models to Assess the Consistency of Randomized Controlled Trials on AI Interventions With CONSORT-AI: Cross-Sectional Survey","year":2025,"lang":"en","type":"article","venue":"Journal of Medical Internet Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"McMaster University; Impact","funders":"Chinese Academy of Medical Sciences; Chongqing Medical University; Lanzhou University","keywords":"Consistency (knowledge bases); Psychological intervention; Randomized controlled trial; Quality (philosophy); MEDLINE; Quality of life (healthcare)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.6919047,0.002440494,0.005236459,0.009403736,0.001668925,0.005983443,0.003069872,0.003704121,0.006693003],"category_scores_gemma":[0.8262405,0.002256776,0.01632004,0.009540983,0.005406467,0.008442976,0.006153744,0.003810131,0.0009703393],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004729808,"about_ca_system_score_gemma":0.006628611,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001541147,"about_ca_topic_score_gemma":0.001619734,"domain_scores_codex":[0.1668048,0.7150202,0.07556055,0.0205653,0.02077459,0.001274522],"domain_scores_gemma":[0.05310207,0.8384022,0.06209306,0.03429712,0.01148041,0.0006251971],"domain_codex":"methods","domain_gemma":"reporting","domain_candidate":"reporting","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01533355,0.001534663,0.6050751,0.03630903,0.1069306,0.0004039667,0.01427502,0.03106765,0.001126134,0.02821933,0.01751377,0.1422112],"study_design_scores_gemma":[0.01775154,0.02253512,0.3306558,0.02818161,0.06412502,0.00198132,0.005941429,0.3495026,0.007872432,0.1193523,0.05014511,0.00195559],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1824404,0.01351666,0.7197782,0.00530868,0.001450362,0.05844116,0.01042594,0.002955652,0.005682961],"genre_scores_gemma":[0.5959803,0.001121331,0.2765866,0.001902003,0.0002399285,0.1189365,0.004456522,0.0003245753,0.0004523007],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.3080953,"threshold_uncertainty_score":0.3799364,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.6667184211202064,"score_gpt":0.6541592626447765,"score_spread":0.01255915847542988,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}