{"id":"W4390347092","doi":"10.2196/48904","title":"Differentiating ChatGPT-Generated and Human-Written Medical Texts: Quantitative Study","year":2023,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":74,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Key Research and Development Program of China; National Natural Science Foundation of China","keywords":"Computer science; Unified Medical Language System; Natural language processing; Artificial intelligence; Perplexity; Fluency; Medical diagnosis; Vocabulary; Context (archaeology); Language model; Information retrieval; Linguistics; Medicine","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.001023258,0.0001567376,0.0002821474,0.0002740039,0.0002878926,0.00003764762,0.0001186636,0.0002490371,0.001540164],"category_scores_gemma":[0.00335901,0.0001316793,0.00004106112,0.000715395,0.0001468016,0.0001022484,0.00005841139,0.0004692148,0.0002381368],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00009006984,"about_ca_system_score_gemma":0.001645468,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008775411,"about_ca_topic_score_gemma":0.0003057135,"domain_scores_codex":[0.997415,0.0001868648,0.0005990462,0.0003976443,0.001080552,0.0003208713],"domain_scores_gemma":[0.9983772,0.0002820753,0.0001123379,0.000236939,0.0002774447,0.0007139881],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001185373,0.005185973,0.4710629,0.0004404136,0.0001233379,0.00005315774,0.04397392,4.55415e-7,0.0007349668,0.004095077,0.03665992,0.4375514],"study_design_scores_gemma":[0.0005935487,0.001832382,0.8832387,0.001122686,0.0001216685,0.0000812567,0.1000728,0.005417853,0.000622562,0.002474262,0.003989509,0.0004327642],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9738993,0.0001721115,0.00004003198,0.02340553,0.0009434572,0.000895791,0.000001144145,0.0001813566,0.0004613025],"genre_scores_gemma":[0.9952224,0.0001020057,0.00006655901,0.002010915,0.001000116,0.0004495035,0.0002187124,0.0000256688,0.0009040449],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4371186,"threshold_uncertainty_score":0.9993725,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1412766185636748,"score_gpt":0.5105681986862469,"score_spread":0.3692915801225721,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}