{"id":"W4388566534","doi":"10.2196/49459","title":"Strengths and Weaknesses of ChatGPT Models for Scientific Writing About Medical Vitamin B12: Mixed Methods Study","year":2023,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":28,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Computer science; Transparency (behavior); Strengths and weaknesses; Scientific writing; Inclusion (mineral); Quality (philosophy); Vitamin B12; Data science; Psychology; Medicine; Linguistics; Social psychology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3898384,0.001973894,0.002857693,0.004120104,0.003128811,0.006404868,0.003786314,0.002055297,0.005359149],"category_scores_gemma":[0.5279378,0.001695343,0.004093474,0.004818246,0.002634005,0.005785277,0.005259637,0.002363701,0.0008566868],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.006119024,"about_ca_system_score_gemma":0.009625307,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00328118,"about_ca_topic_score_gemma":0.006727389,"domain_scores_codex":[0.5421636,0.3685606,0.04643201,0.01006864,0.03091121,0.001863871],"domain_scores_gemma":[0.2188402,0.6795834,0.0339078,0.02915316,0.03645101,0.002064495],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.01672349,0.006442725,0.1618311,0.07388882,0.01281753,0.0008522694,0.1737994,0.002348134,0.002392552,0.009968702,0.01025121,0.528684],"study_design_scores_gemma":[0.01715532,0.06088747,0.3346283,0.1119785,0.03753534,0.003007923,0.1445991,0.05515315,0.02218501,0.04315715,0.1672506,0.002462135],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.624857,0.02075033,0.1947553,0.007951289,0.0020901,0.1218693,0.005079237,0.001355788,0.02129155],"genre_scores_gemma":[0.632422,0.00245461,0.1415672,0.003673483,0.0005104897,0.216317,0.001035321,0.0003535789,0.00166635],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.6101616,"threshold_uncertainty_score":0.7524379,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3206653057813759,"score_gpt":0.6195661621680509,"score_spread":0.298900856386675,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}