{"id":"W4404654936","doi":"10.2196/63129","title":"Performance of ChatGPT-4o on the Japanese Medical Licensing Examination: Evalution of Accuracy in Text-Only and Image-Based Questions","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":14,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Preprint; Psychology; Computer science; World Wide Web","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007914626,0.0009209162,0.0009714729,0.001069246,0.0003710871,0.0009835815,0.001099023,0.001406662,0.002668421],"category_scores_gemma":[0.04658191,0.0002223801,0.0006883577,0.0003777494,0.0004510276,0.001673515,0.001823198,0.0007919996,0.001854271],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006109081,"about_ca_system_score_gemma":0.0008421896,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005511642,"about_ca_topic_score_gemma":0.005530532,"domain_scores_codex":[0.996039,0.002384434,0.0003388691,0.0005870571,0.0004562736,0.0001943284],"domain_scores_gemma":[0.9618783,0.0301583,0.001626437,0.0014494,0.003339656,0.001547952],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01013001,0.002121866,0.5076512,0.001387539,0.0005311741,0.0007651386,0.004749991,0.01149327,0.01330902,0.0002391009,0.008602911,0.4390188],"study_design_scores_gemma":[0.0006747267,0.00860284,0.5788937,0.000545672,0.0009902285,0.002342913,0.004710714,0.3632164,0.03002139,0.00134987,0.008257206,0.0003943497],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9881196,0.0004829233,0.006642299,0.0003001177,0.0001155232,0.0002784471,0.0007489098,0.00105678,0.002255409],"genre_scores_gemma":[0.9893054,0.0001646814,0.007612718,0.0001594756,0.0000640634,0.0001589704,0.001172474,0.00006152726,0.001300858],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007914626,"threshold_uncertainty_score":0.04185706,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05894639362884545,"score_gpt":0.4490566095975038,"score_spread":0.3901102159686584,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}