{"id":"W4405623292","doi":"10.2196/63731","title":"Qwen-2.5 Outperforms Other Large Language Models in the Chinese National Nursing Licensing Examination: Retrospective Cross-Sectional Comparative Study","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Nursing Diagnosis and Documentation","field":"Nursing","cited_by":26,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Preprint; Cross-sectional study; Medicine; Nursing; Computer science; World Wide Web","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009382582,0.0007699626,0.0008558644,0.001135013,0.000625849,0.0008768774,0.001118211,0.0008369516,0.001780771],"category_scores_gemma":[0.02271304,0.00043994,0.001159713,0.0007639163,0.0007284984,0.001500609,0.001065886,0.001235894,0.0006985322],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001266145,"about_ca_system_score_gemma":0.001651242,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02659471,"about_ca_topic_score_gemma":0.02276849,"domain_scores_codex":[0.9976399,0.000845442,0.0002444554,0.0005811968,0.0004160142,0.000273058],"domain_scores_gemma":[0.9854429,0.006474949,0.001799933,0.001122238,0.004201914,0.0009581211],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0008625712,0.0004463042,0.9826418,0.0001114744,0.000277158,0.0002222963,0.0007742484,0.000540339,0.0002074165,0.00007623516,0.001260666,0.01257943],"study_design_scores_gemma":[0.00007271677,0.00165833,0.9838824,0.00008100399,0.0005266952,0.0004050354,0.001643879,0.008906574,0.000783307,0.0001375165,0.001845649,0.00005683433],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9980514,0.0004012923,0.0003415031,0.0001126867,0.00001735637,0.0000537893,0.0007223625,0.00001319253,0.0002863849],"genre_scores_gemma":[0.9970131,0.0001916582,0.0003177706,0.0001134379,0.00003269078,0.00008355553,0.001827983,0.0000153489,0.0004045164],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02659471,"threshold_uncertainty_score":0.05287981,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02972743349575719,"score_gpt":0.4125477591948185,"score_spread":0.3828203256990613,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}