{"id":"W4299286150","doi":"10.1177/08465371221131200","title":"U“AI” Testing: User Interface and Usability Testing of a Chest X-ray AI Tool in a Simulated Real-World Workflow","year":2022,"lang":"en","type":"article","venue":"Canadian Association of Radiologists Journal","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":17,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute; Trillium Health Centre; University of Toronto","funders":"","keywords":"Workflow; Usability; Software deployment; Triage; Medicine; Automation; Computer science; Artificial intelligence; Medical physics; Human–computer interaction; Software engineering; Medical emergency; Database","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.002484316,0.00009995072,0.0003470265,0.0004021823,0.0001910873,0.0000198543,0.00009901754,0.0000967919,0.0001289622],"category_scores_gemma":[0.01053911,0.0001037968,0.00004574866,0.00088114,0.0000768886,0.00009610785,0.0000199898,0.0007518344,0.000001003865],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002701171,"about_ca_system_score_gemma":0.002014163,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.07179628,"about_ca_topic_score_gemma":0.05833779,"domain_scores_codex":[0.9981501,0.0003258512,0.0008011568,0.0001725842,0.0002252632,0.0003250391],"domain_scores_gemma":[0.9973509,0.001129141,0.0005830573,0.0001348104,0.0005945641,0.0002074964],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00004738976,0.00005117992,0.976988,0.00003649866,0.00002335818,0.00001407389,0.0009961277,0.007550204,0.0003474449,0.00002932788,0.001455338,0.01246103],"study_design_scores_gemma":[0.0002160467,0.0004322331,0.9850357,0.0001548957,0.00003448727,0.00006561495,0.0009993522,0.009630668,0.0002257129,0.00114868,0.001933775,0.000122802],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.991223,0.00009404253,0.00005706518,0.007736607,0.0002952125,0.0002601029,0.00001839945,0.00001066074,0.0003049087],"genre_scores_gemma":[0.9977334,0.00001814663,0.001180772,0.0006403588,0.0001260936,0.000006249551,0.000007972631,0.00001024114,0.0002768278],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01345849,"threshold_uncertainty_score":0.9977955,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1068314061063364,"score_gpt":0.3797614144259395,"score_spread":0.2729300083196031,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}