{"id":"W4392746026","doi":"10.2196/55627","title":"Evaluating ChatGPT-4’s Diagnostic Accuracy: Impact of Visual Data Integration","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":49,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Computer science; Visualization; Artificial intelligence","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.001265055,0.0001285941,0.0002510434,0.0001749683,0.0000496206,0.00004912383,0.0002234576,0.0001912139,0.0009839104],"category_scores_gemma":[0.01051902,0.00008844007,0.00008723356,0.0004113014,0.0001076268,0.0005823277,0.0001085359,0.000463808,0.0002486133],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001464317,"about_ca_system_score_gemma":0.00182569,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002614468,"about_ca_topic_score_gemma":0.00001947529,"domain_scores_codex":[0.9976775,0.00004203865,0.001050503,0.000122688,0.0008728152,0.0002344268],"domain_scores_gemma":[0.9968984,0.001984694,0.0001513879,0.0004458293,0.0002220719,0.0002976343],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0000398738,0.0001596752,0.001643241,0.0008964214,0.00006082102,0.000008675951,0.01291007,0.00001429434,0.00011847,0.0002051711,0.00966806,0.9742752],"study_design_scores_gemma":[0.00008021485,0.00117463,0.002746151,0.002515885,0.00009205047,0.00009840181,0.004720172,0.9856365,0.001276483,0.0004452405,0.001084033,0.0001302353],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9892151,0.0004352623,0.006797686,0.00140985,0.0007003684,0.0006506734,0.00001958849,0.0001074137,0.0006640269],"genre_scores_gemma":[0.9968914,0.0002988806,0.00113313,0.000363848,0.0005949818,0.00004177728,0.0006182994,0.00001382142,0.00004385592],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9856222,"threshold_uncertainty_score":0.9999293,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2946985073750304,"score_gpt":0.5913097477380574,"score_spread":0.296611240363027,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}