{"id":"W4388774693","doi":"10.1101/2023.11.15.23298575","title":"GPT-4V(ision) Unsuitable for Clinical Care and Education: A Clinician-Evaluated Assessment","year":2023,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute; University of Toronto; University Health Network","funders":"","keywords":"Modalities; Certification; Medical imaging; Medical decision making; Medical physics; Medical care; Medicine; Clinical decision making; Interpretation (philosophy); Medical education; Medical assessment; Modality (human–computer interaction); Psychology; Radiology; Medical emergency; Intensive care medicine; Family medicine; Computer science; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01000052,0.0005592816,0.0005136736,0.0009996454,0.0005435051,0.002161058,0.001099373,0.00126234,0.006709251],"category_scores_gemma":[0.06414272,0.0002930178,0.0007783644,0.0004390062,0.00111388,0.001983516,0.002824701,0.001245239,0.001979815],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001142181,"about_ca_system_score_gemma":0.002200854,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004049104,"about_ca_topic_score_gemma":0.003504375,"domain_scores_codex":[0.9955643,0.00215692,0.0003817953,0.0004264961,0.001218007,0.0002525111],"domain_scores_gemma":[0.9711539,0.01767169,0.001952424,0.002412639,0.005081727,0.001727536],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.004240757,0.001953998,0.4975168,0.0008806029,0.0002316024,0.006706653,0.01288753,0.01125895,0.009645859,0.008626366,0.07967974,0.3663711],"study_design_scores_gemma":[0.001131202,0.007579491,0.3698587,0.002854852,0.000869005,0.02266432,0.01852179,0.3816078,0.03657252,0.03604737,0.121658,0.0006349329],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9535902,0.0005025687,0.02214967,0.003342822,0.0001902073,0.0006663954,0.001778963,0.00135356,0.01642563],"genre_scores_gemma":[0.9729355,0.0002733181,0.02124555,0.0007895084,0.00004150462,0.0004363938,0.001621298,0.0002416817,0.002415275],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9899995,"threshold_uncertainty_score":0.05288839,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.492790890048224,"score_gpt":0.6123297093763679,"score_spread":0.1195388193281439,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}