{"id":"W4378528433","doi":"10.2196/47305","title":"Performance of the Large Language Model ChatGPT on the National Nurse Examinations in Japan: Evaluation Study","year":2023,"lang":"en","type":"article","venue":"JMIR Nursing","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":79,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Japan Society for the Promotion of Science","keywords":"Multiple choice; Test (biology); Certification; Specialty; Reading (process); Simple (philosophy); Medicine; Nursing; Psychology; Medical education; Family medicine; Linguistics; Political science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01111652,0.001395258,0.001407131,0.001747417,0.0007193901,0.0009989837,0.001126354,0.0007941815,0.001980647],"category_scores_gemma":[0.03574083,0.0004970879,0.001290152,0.001140431,0.0006317571,0.001620725,0.002420283,0.0006916328,0.001137595],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001525597,"about_ca_system_score_gemma":0.002189085,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009034468,"about_ca_topic_score_gemma":0.009399594,"domain_scores_codex":[0.9905711,0.005719202,0.001090627,0.0009982379,0.00125606,0.0003647299],"domain_scores_gemma":[0.9629316,0.01878147,0.003463302,0.002258612,0.008905278,0.003659603],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01665414,0.009079125,0.5933156,0.002273351,0.0005083298,0.001734117,0.01247277,0.006636687,0.00838575,0.0002055496,0.006701221,0.3420334],"study_design_scores_gemma":[0.001477097,0.01896831,0.8838938,0.0003333643,0.001037974,0.002043597,0.005607493,0.07097534,0.008470817,0.0002745948,0.006569392,0.0003482331],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9960769,0.000186016,0.001693833,0.00008926015,0.00002869111,0.0005134752,0.0003957544,0.0001998615,0.0008161202],"genre_scores_gemma":[0.9863015,0.0002934992,0.009269474,0.0001334468,0.00007724104,0.001032124,0.001734065,0.00006502531,0.001093533],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01111652,"threshold_uncertainty_score":0.0587905,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2435107861828159,"score_gpt":0.5128631239450444,"score_spread":0.2693523377622285,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}