{"id":"W4407719815","doi":"10.1177/22925503251315489","title":"Beyond the Surface: Assessing GPT-4's Accuracy in Detecting Melanoma and Suspicious Skin Lesions From Dermoscopic Images","year":2025,"lang":"en","type":"article","venue":"Plastic Surgery","topic":"Cutaneous Melanoma Detection and Management","field":"Medicine","cited_by":13,"is_retracted":false,"has_abstract":true,"ca_institutions":"Princess Margaret Cancer Centre; University of Toronto","funders":"","keywords":"Melanoma; Melanoma diagnosis; Artificial intelligence; Dermatology; Medicine; Radiology; Nuclear medicine; Computer science; Cancer research","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003489344,0.0008735037,0.0005229376,0.001430033,0.0002878458,0.001485243,0.001075756,0.0009556467,0.002376323],"category_scores_gemma":[0.01484344,0.000255304,0.001045046,0.0005189207,0.000338727,0.0009695759,0.001242989,0.0006367086,0.000916377],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006076023,"about_ca_system_score_gemma":0.0005431738,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005315824,"about_ca_topic_score_gemma":0.004382655,"domain_scores_codex":[0.9985128,0.0005268719,0.00009759394,0.0004368688,0.0003285347,0.00009736107],"domain_scores_gemma":[0.9950091,0.002991711,0.0004344223,0.0005037737,0.0008365062,0.0002246358],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.004291363,0.000561082,0.6816059,0.001233335,0.00130351,0.0005320756,0.000370153,0.05018856,0.009106883,0.0006210961,0.02123299,0.228953],"study_design_scores_gemma":[0.0001856445,0.00168307,0.3524673,0.000339578,0.0007890378,0.002436262,0.0004749727,0.6177341,0.01396288,0.002482847,0.007344923,0.00009949789],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9598681,0.002011459,0.02126361,0.0006108939,0.0002069545,0.0003754639,0.00690095,0.003480921,0.005281603],"genre_scores_gemma":[0.9797609,0.0001978093,0.01341927,0.0001298678,0.00005594372,0.00009956017,0.005493067,0.0001010975,0.0007424862],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.005315824,"threshold_uncertainty_score":0.01845366,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01594977064736323,"score_gpt":0.2751757988256273,"score_spread":0.259226028178264,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}