{"id":"W4412010526","doi":"10.2196/68666","title":"Evaluating a Customized Version of ChatGPT for Systematic Review Data Extraction in Health Research: Development and Usability Study","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Preprint; Data extraction; Systematic review; Computer science; Data science; MEDLINE; World Wide Web; Political science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.1919393,0.002048669,0.002261365,0.005597659,0.00105953,0.003098944,0.002865763,0.001438705,0.007974316],"category_scores_gemma":[0.3787565,0.002935933,0.004819513,0.005272799,0.001024499,0.004493774,0.005006499,0.002170562,0.001942259],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003218076,"about_ca_system_score_gemma":0.008417032,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001206802,"about_ca_topic_score_gemma":0.005339413,"domain_scores_codex":[0.8962547,0.06664138,0.02552328,0.004442627,0.006441329,0.0006967022],"domain_scores_gemma":[0.4069882,0.5081723,0.02090032,0.02892142,0.03349983,0.001517845],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.009557477,0.001631771,0.01508114,0.1038039,0.005805356,0.001120354,0.01842365,0.01031726,0.01775756,0.00303888,0.04091281,0.7725498],"study_design_scores_gemma":[0.04982305,0.03279239,0.1563435,0.06678517,0.03659228,0.008848721,0.0114538,0.2835766,0.07755928,0.0184131,0.2541568,0.003655311],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1831271,0.004231035,0.5680871,0.003292514,0.001102337,0.1622226,0.01629733,0.05591374,0.005726204],"genre_scores_gemma":[0.06760384,0.0008079738,0.8480186,0.0006014524,0.00006935518,0.07669647,0.003521634,0.001813496,0.000867228],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8080607,"threshold_uncertainty_score":0.9964827,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.7551841346258059,"score_gpt":0.70070760363615,"score_spread":0.05447653098965588,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}