{"id":"W4415834054","doi":"10.2196/78279","title":"Performance of the Large Language Models on the Chinese National Nurse Licensure Examination: Cross-Sectional Evaluation Study","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Medical Education and Admissions","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Reliability (semiconductor); Licensure; Trustworthiness; Calibration; MEDLINE; Nurse education","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02312776,0.0008802682,0.0008376461,0.0009996106,0.0007083279,0.001186899,0.001295845,0.001048783,0.00199555],"category_scores_gemma":[0.06283461,0.0004479047,0.001658253,0.0005637486,0.001111552,0.001895756,0.001822232,0.001433238,0.001300155],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001845138,"about_ca_system_score_gemma":0.001701122,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01091191,"about_ca_topic_score_gemma":0.0111509,"domain_scores_codex":[0.9904425,0.00433699,0.00086003,0.001632509,0.002274895,0.0004531327],"domain_scores_gemma":[0.9451842,0.02221322,0.007462766,0.006100804,0.01595805,0.003080989],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001795125,0.001588441,0.967343,0.0001535674,0.0006527905,0.0001682904,0.001986126,0.001650121,0.0004036111,0.000126641,0.002422364,0.02170998],"study_design_scores_gemma":[0.0001495476,0.005656135,0.9708801,0.0001325846,0.0006098463,0.0003791254,0.001508956,0.01593263,0.001937365,0.0002133616,0.002484647,0.0001155961],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9979874,0.0001414127,0.0005533328,0.00006428482,0.00001854557,0.000145914,0.0005636034,0.00002867853,0.0004968122],"genre_scores_gemma":[0.9965978,0.0001052435,0.0006225458,0.00008340643,0.00002553908,0.0002647844,0.001771461,0.00002390831,0.0005053023],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02312776,"threshold_uncertainty_score":0.1223127,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03420382067342595,"score_gpt":0.4262020720747439,"score_spread":0.3919982514013179,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}