{"id":"W4398175922","doi":"10.2196/51187","title":"The Use of Generative AI for Scientific Literature Searches for Systematic Reviews: ChatGPT and Microsoft Bing AI Performance Evaluation","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":45,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Computer science; Data science; Information retrieval; World Wide Web; Artificial intelligence","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2936394,0.004611734,0.01101591,0.04588886,0.002488362,0.01026742,0.004707776,0.00481869,0.0101564],"category_scores_gemma":[0.6497408,0.002891945,0.01621414,0.0402079,0.002906544,0.01023907,0.011156,0.003301261,0.001632695],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.007336427,"about_ca_system_score_gemma":0.01561426,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004036364,"about_ca_topic_score_gemma":0.007987772,"domain_scores_codex":[0.6219298,0.2649238,0.08404036,0.008567737,0.0189227,0.001615565],"domain_scores_gemma":[0.1358614,0.8108497,0.02439268,0.01392317,0.01319643,0.001776732],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.03681923,0.001550034,0.04050883,0.2344856,0.03957145,0.0008814149,0.01028473,0.03369775,0.002736472,0.01227915,0.03446748,0.5527178],"study_design_scores_gemma":[0.03887282,0.01797013,0.05668133,0.04763794,0.07420783,0.003867885,0.006662691,0.6227131,0.009993269,0.05651392,0.06202678,0.002852266],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2628271,0.09411204,0.3697825,0.01314308,0.003287471,0.117179,0.0638356,0.0563546,0.01947859],"genre_scores_gemma":[0.2270571,0.006417859,0.6623719,0.0009183121,0.0002346713,0.0912099,0.009549632,0.00145004,0.0007906315],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.7063606,"threshold_uncertainty_score":0.8710684,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3173253048606453,"score_gpt":0.4986945925217383,"score_spread":0.181369287661093,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}