{"id":"W4401641570","doi":"10.2196/57162","title":"Evaluation of AI-Driven LabTest Checker for Diagnostic Accuracy and Safety: Prospective Cohort Study","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Medical diagnosis; Medicine; Clinical decision support system; Test (biology); Gold standard (test); Patient safety; Medical physics; Health care; Medical emergency; Prospective cohort study; Diagnostic accuracy; Artificial intelligence; Computer science; Decision support system; Pathology; Internal medicine","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008762489,0.0005077106,0.0005593899,0.0009663524,0.001024449,0.001623812,0.0009525529,0.0008677424,0.00281741],"category_scores_gemma":[0.02156223,0.0005114372,0.001084957,0.0007928499,0.0005652469,0.001307153,0.0009255666,0.001318114,0.000736948],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007748334,"about_ca_system_score_gemma":0.001290234,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003397726,"about_ca_topic_score_gemma":0.003470286,"domain_scores_codex":[0.9959721,0.00151141,0.0004299537,0.0008015641,0.0009389404,0.0003460507],"domain_scores_gemma":[0.9860405,0.00443875,0.003444438,0.002225557,0.002651438,0.001199338],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001158692,0.0005378132,0.9951444,0.00003211122,0.0001553459,0.00008044818,0.0003162981,0.00005070238,0.0001127885,0.00005201932,0.0002945112,0.002064805],"study_design_scores_gemma":[0.0003047153,0.008278872,0.9857589,0.00005835021,0.0004046049,0.000571372,0.001168533,0.001949574,0.0003046368,0.0001429751,0.001014206,0.00004323637],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9982991,0.0001247022,0.0004202242,0.00004411871,0.00001794248,0.0002181149,0.0005012443,0.000009275748,0.0003653367],"genre_scores_gemma":[0.9984641,0.00005252035,0.0005792456,0.00006759953,0.00002017763,0.0001783979,0.0004252605,0.000007739891,0.0002049399],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.008762489,"threshold_uncertainty_score":0.04634106,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1049382544730949,"score_gpt":0.481556908129329,"score_spread":0.376618653656234,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}