{"id":"W4406038238","doi":"10.2340/actadv.v105.41208","title":"Assessing ChatGPT-4’s Capabilities in Generating Dermatology Board Examination Content: An Explorational Study","year":2025,"lang":"en","type":"article","venue":"Acta Dermato Venereologica","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":3,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Medicine; Dermatology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.00835301,0.0006955435,0.0004257754,0.001549663,0.0002777011,0.001879302,0.001426763,0.0009307381,0.003723523],"category_scores_gemma":[0.08022039,0.000329234,0.0005328651,0.0007658022,0.0003835265,0.001912284,0.001650559,0.001007547,0.001702618],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000718359,"about_ca_system_score_gemma":0.001094795,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005319305,"about_ca_topic_score_gemma":0.004322986,"domain_scores_codex":[0.9957222,0.002430533,0.0003568609,0.000502623,0.0007917354,0.00019613],"domain_scores_gemma":[0.857975,0.1233596,0.003481828,0.004395962,0.008117312,0.002670249],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.005770951,0.002741295,0.4943513,0.001310728,0.0005227894,0.0009454926,0.01292187,0.01188893,0.01265894,0.001050802,0.0078639,0.4479731],"study_design_scores_gemma":[0.0008428367,0.01013602,0.6822998,0.0008592068,0.001247294,0.003340704,0.01375093,0.2242202,0.02815405,0.002788055,0.03198065,0.0003802348],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9850726,0.0002192752,0.007134582,0.0002039957,0.00004732121,0.0004238479,0.0007508762,0.00129827,0.004849279],"genre_scores_gemma":[0.9702331,0.0002100547,0.02442382,0.000138197,0.00002700068,0.000335683,0.001513544,0.0001524979,0.002966141],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.991647,"threshold_uncertainty_score":0.04417545,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2833429946042172,"score_gpt":0.4450340450049065,"score_spread":0.1616910504006893,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}