{"id":"W4416814854","doi":"10.1177/00469580251399374","title":"A Pilot Study on Generative Artificial Intelligence’s Reliability in Qualitative Research Quality Appraisal Using CASP and JBI Checklists","year":2025,"lang":"en","type":"article","venue":"INQUIRY The Journal of Health Care Organization Provision and Financing","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Toronto Metropolitan University; Public Health Agency of Canada; University of Guelph","funders":"","keywords":"Checklist; Inter-rater reliability; Critical appraisal; CASP; Qualitative research; Reliability (semiconductor); Research design; Human research","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4249645,0.0008975566,0.001733462,0.003625807,0.004258657,0.004042596,0.002466631,0.001634505,0.004213098],"category_scores_gemma":[0.5518648,0.001543003,0.002182327,0.004064229,0.004875103,0.004151445,0.005857261,0.002975392,0.0009326151],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00817109,"about_ca_system_score_gemma":0.0180708,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003033618,"about_ca_topic_score_gemma":0.008039034,"domain_scores_codex":[0.6562713,0.2976866,0.02385052,0.006154952,0.01262749,0.003409044],"domain_scores_gemma":[0.2329099,0.6164141,0.01970746,0.03344254,0.09409919,0.003426783],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.00366966,0.002513209,0.05272894,0.01395202,0.0003096398,0.001788061,0.7314125,0.001386357,0.008981926,0.006175122,0.007267591,0.169815],"study_design_scores_gemma":[0.008631778,0.03439226,0.1638687,0.03461382,0.001319673,0.00311223,0.5753801,0.02084854,0.0239493,0.02251076,0.1101777,0.001195145],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7704096,0.00113408,0.09070423,0.004435707,0.0008061111,0.1240988,0.001075306,0.0005545637,0.006781637],"genre_scores_gemma":[0.5513333,0.0005717531,0.1507568,0.001530589,0.0001304042,0.293785,0.0004371757,0.0001500328,0.001304943],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5750356,"threshold_uncertainty_score":0.7091212,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4243587056817439,"score_gpt":0.6018586717368326,"score_spread":0.1774999660550887,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}