{"id":"W4401030406","doi":"10.1177/12034754241266166","title":"The Performance of Artificial Intelligence Chatbot (GPT-4) on Image-Based Dermatology Certification Board Exam Questions","year":2024,"lang":"en","type":"letter","venue":"Journal of Cutaneous Medicine and Surgery","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Medicine; Board certification; Certification; Dermatology; Medical physics; Medical education; Residency training","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01486562,0.0009449085,0.0008902742,0.001418635,0.0009332921,0.001918713,0.001386573,0.001847567,0.01667721],"category_scores_gemma":[0.1810955,0.0003341661,0.0004808018,0.0007964787,0.0007025127,0.001826218,0.002308315,0.001380042,0.005787603],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001310701,"about_ca_system_score_gemma":0.001058843,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003085625,"about_ca_topic_score_gemma":0.004360123,"domain_scores_codex":[0.9829454,0.01216181,0.001003096,0.00142867,0.001937233,0.0005237189],"domain_scores_gemma":[0.7074959,0.2651485,0.005400898,0.004522569,0.01455809,0.002874122],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.01303699,0.004492397,0.06891668,0.00445125,0.0002399755,0.002226387,0.02974898,0.01170195,0.03100493,0.002025977,0.1712849,0.6608696],"study_design_scores_gemma":[0.002876061,0.02156595,0.3034423,0.002973645,0.0005960813,0.002896125,0.02374655,0.3710234,0.09112767,0.00903642,0.169529,0.001186655],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9384928,0.0007010087,0.01876067,0.004198027,0.00177573,0.002071273,0.00418261,0.008186819,0.02163104],"genre_scores_gemma":[0.9215621,0.0002608908,0.05468547,0.002686783,0.0006084766,0.00206512,0.004943732,0.001093277,0.01209413],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01667721,"threshold_uncertainty_score":0.07861787,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1274474529137883,"score_gpt":0.3770695443896627,"score_spread":0.2496220914758743,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}