{"id":"W4385080756","doi":"10.2196/47049","title":"The Potential and Concerns of Using AI in Scientific Research: ChatGPT Performance Evaluation","year":2023,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":186,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Thematic analysis; Context (archaeology); Quality (philosophy); Computer science; Data science; Data quality; Qualitative research; Social science; Engineering; Sociology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4299125,0.001564061,0.002637795,0.02032056,0.003974865,0.01352734,0.004264055,0.003760648,0.003994391],"category_scores_gemma":[0.7754654,0.001283329,0.00367446,0.01539613,0.004634559,0.009377761,0.01231666,0.002670975,0.001575198],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.008486327,"about_ca_system_score_gemma":0.01208098,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001913464,"about_ca_topic_score_gemma":0.004181604,"domain_scores_codex":[0.4622087,0.3874717,0.06973118,0.008831349,0.06881865,0.002938402],"domain_scores_gemma":[0.06020509,0.7859151,0.04244132,0.02239372,0.08479005,0.004254737],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.01010313,0.001666499,0.09229558,0.05500327,0.003562508,0.00275569,0.0916874,0.005399973,0.01059346,0.006342134,0.02091388,0.6996765],"study_design_scores_gemma":[0.01076921,0.03680095,0.3189283,0.08051427,0.01710613,0.0104133,0.1006683,0.08664774,0.06568131,0.04518127,0.2240366,0.003252649],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7212851,0.02214777,0.1304177,0.02293285,0.003357758,0.03944332,0.004713627,0.005934735,0.04976714],"genre_scores_gemma":[0.7211637,0.004568899,0.2279224,0.002422378,0.0008578196,0.03739125,0.00204819,0.0007768678,0.002848448],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5700874,"threshold_uncertainty_score":0.7030194,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3978155569671569,"score_gpt":0.5939620970070143,"score_spread":0.1961465400398574,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}