{"id":"W4410800786","doi":"10.1016/j.compbiomed.2025.110464","title":"Enhancing search strategies for systematic reviews on drug Harms: An evaluation of the utility of ChatGPT in error detection and keyword generation","year":2025,"lang":"en","type":"article","venue":"Computers in Biology and Medicine","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Drug; Information retrieval; Data mining; Machine learning; Risk analysis (engineering); Medicine; Pharmacology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2304947,0.003766514,0.005739553,0.02264954,0.001488044,0.004158281,0.003407117,0.003121845,0.004518606],"category_scores_gemma":[0.5884925,0.002093395,0.0069731,0.01628781,0.001337851,0.007669803,0.009788311,0.001862023,0.001094469],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003296573,"about_ca_system_score_gemma":0.007811382,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002509108,"about_ca_topic_score_gemma":0.004943719,"domain_scores_codex":[0.7180927,0.1999436,0.05902497,0.006599021,0.01528264,0.001057029],"domain_scores_gemma":[0.168876,0.761781,0.02955437,0.01643773,0.02165178,0.001698966],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.02401981,0.001198555,0.03501645,0.1462756,0.01872234,0.001050368,0.012944,0.01107655,0.009514247,0.002398582,0.009098919,0.7286845],"study_design_scores_gemma":[0.04777814,0.05727903,0.1705076,0.07974982,0.1315529,0.01172468,0.01648876,0.2908646,0.06734436,0.02714628,0.09457601,0.004987851],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4977839,0.05964312,0.3035424,0.006836982,0.001544504,0.0858411,0.01466817,0.0208896,0.0092503],"genre_scores_gemma":[0.3073108,0.006995073,0.6515607,0.00154571,0.0002998307,0.02730088,0.003634737,0.0005085043,0.000843904],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7695053,"threshold_uncertainty_score":0.948937,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.6771509663436753,"score_gpt":0.5768478573733766,"score_spread":0.1003031089702987,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}