{"id":"W4392746026","doi":"10.2196/55627","title":"Evaluating ChatGPT-4’s Diagnostic Accuracy: Impact of Visual Data Integration","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":49,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Computer science; Visualization; Artificial intelligence","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02431818,0.0009038359,0.0008310379,0.007214475,0.0006589037,0.003309774,0.002389779,0.001590989,0.00353565],"category_scores_gemma":[0.1306389,0.0004187977,0.00170646,0.00271892,0.001129912,0.002461688,0.00407499,0.0009462571,0.0008765716],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0013371,"about_ca_system_score_gemma":0.001421135,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002468089,"about_ca_topic_score_gemma":0.003042035,"domain_scores_codex":[0.983606,0.007689754,0.002806045,0.001767917,0.003597776,0.0005325635],"domain_scores_gemma":[0.8858654,0.07732081,0.00802526,0.009159948,0.01752041,0.002108145],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.004670042,0.0002229179,0.7488308,0.002182313,0.001458938,0.001987876,0.001355942,0.01032011,0.007120624,0.001518382,0.006433622,0.2138984],"study_design_scores_gemma":[0.0007526451,0.003109973,0.563208,0.002198969,0.003338606,0.02511751,0.00505298,0.295943,0.05789058,0.0126922,0.03022623,0.0004693211],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.896706,0.00599946,0.07420082,0.001830931,0.0005313873,0.001422824,0.005722366,0.003088839,0.01049734],"genre_scores_gemma":[0.934898,0.0005702092,0.05963923,0.0002546891,0.0001290862,0.0004126338,0.003325389,0.0001672808,0.0006034666],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02431818,"threshold_uncertainty_score":0.1286084,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2946985073750304,"score_gpt":0.5913097477380574,"score_spread":0.296611240363027,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}