{"id":"W4389896239","doi":"10.1097/gox.0000000000005448","title":"Can a Machine Ace the Test? Assessing GPT-4.0’s Precision in Plastic Surgery Board Examinations","year":2023,"lang":"en","type":"article","venue":"Plastic & Reconstructive Surgery Global Open","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"CLARITY; Computer science; Artificial intelligence; Completeness (order theory); Scale (ratio); Medical physics; Machine learning; Plastic surgery; Test (biology); Medicine; Surgery; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01949417,0.0006993329,0.0005239365,0.001345527,0.0003600605,0.002366204,0.001014153,0.001229736,0.004995629],"category_scores_gemma":[0.1362564,0.000294884,0.0009435118,0.0006408194,0.0009294434,0.002291751,0.001922987,0.001076189,0.002344229],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001121341,"about_ca_system_score_gemma":0.001714237,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001748228,"about_ca_topic_score_gemma":0.001908082,"domain_scores_codex":[0.9899746,0.006375439,0.0006793629,0.0007559705,0.00190356,0.0003109781],"domain_scores_gemma":[0.9036746,0.0770525,0.00748358,0.004265628,0.006326377,0.001197401],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001564484,0.001023356,0.509471,0.0007862746,0.0002793248,0.0004828795,0.005879088,0.02542885,0.006050212,0.002683658,0.01247946,0.4338714],"study_design_scores_gemma":[0.0004693372,0.006772305,0.5523538,0.002238918,0.0006952978,0.00253611,0.008266214,0.3400004,0.02673713,0.01404759,0.04546258,0.0004203298],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9183176,0.0005604204,0.06032141,0.003665106,0.0002085275,0.0008097367,0.0008862235,0.001746584,0.01348437],"genre_scores_gemma":[0.9490181,0.0003202963,0.04678307,0.0005844375,0.00005558812,0.0003241228,0.0007706695,0.0001157137,0.002028077],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01949417,"threshold_uncertainty_score":0.1030963,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1464212235719897,"score_gpt":0.4064276775336855,"score_spread":0.2600064539616958,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}