{"id":"W4390347092","doi":"10.2196/48904","title":"Differentiating ChatGPT-Generated and Human-Written Medical Texts: Quantitative Study","year":2023,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":74,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Key Research and Development Program of China; National Natural Science Foundation of China","keywords":"Computer science; Unified Medical Language System; Natural language processing; Artificial intelligence; Perplexity; Fluency; Medical diagnosis; Vocabulary; Context (archaeology); Language model; Information retrieval; Linguistics; Medicine","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01336903,0.0004613415,0.0004800599,0.003643152,0.0006727102,0.001465095,0.0006622038,0.0008302444,0.002447842],"category_scores_gemma":[0.1285114,0.0001951519,0.0004094248,0.001645437,0.002055746,0.001894259,0.001695918,0.0009094744,0.0006843024],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000968273,"about_ca_system_score_gemma":0.0004928943,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007055589,"about_ca_topic_score_gemma":0.0008276898,"domain_scores_codex":[0.983848,0.01020713,0.00133098,0.001761313,0.002565323,0.0002872422],"domain_scores_gemma":[0.691586,0.2682109,0.01346264,0.006166242,0.01773238,0.002841976],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002714761,0.003567501,0.5519213,0.005848826,0.0006762283,0.002773554,0.1187765,0.008455987,0.04184689,0.00326665,0.009225444,0.2509263],"study_design_scores_gemma":[0.0002828345,0.0036511,0.8158749,0.0007609197,0.0003560473,0.005024094,0.04704548,0.06339636,0.03917507,0.005018005,0.01901313,0.0004020878],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.989581,0.0002251969,0.006812893,0.0001047937,0.00002780597,0.0004002407,0.0008642879,0.0001514546,0.001832283],"genre_scores_gemma":[0.9904509,0.00009673667,0.006793623,0.00009676583,0.00004143159,0.0004595123,0.001376393,0.00006144712,0.0006231905],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.986631,"threshold_uncertainty_score":0.07070309,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1412766185636748,"score_gpt":0.5105681986862469,"score_spread":0.3692915801225721,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}