{"id":"W4320062020","doi":"10.2196/43960","title":"Performance of a Web-Based Reference Database With Natural Language Searching Capabilities: Usability Evaluation of DynaMed and Micromedex With Watson","year":2023,"lang":"en","type":"article","venue":"JMIR Human Factors","topic":"Electronic Health Records Systems","field":"Health Professions","cited_by":14,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Canadian Institutes of Health Research; Brigham and Women's Hospital","keywords":"Medicine; Usability; Likert scale; Watson; Health care; Think aloud protocol; Medical education; Human–computer interaction; Computer science; Artificial intelligence; Psychology","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003310609,0.000193115,0.0004239806,0.0002626673,0.0003566589,0.000005804688,0.0001788553,0.0001090056,0.0001532178],"category_scores_gemma":[0.0002439486,0.00012955,0.00002406062,0.0004613031,0.000253197,0.0001871406,0.00006088653,0.0007116466,0.000007008779],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004987914,"about_ca_system_score_gemma":0.001514453,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00284303,"about_ca_topic_score_gemma":0.008002141,"domain_scores_codex":[0.9964284,0.001137229,0.0006013389,0.0003724229,0.0008709276,0.0005897331],"domain_scores_gemma":[0.997614,0.0008661312,0.0003924065,0.0005623962,0.0004318195,0.0001332143],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000282413,0.00007008161,0.9441202,0.006948517,0.00002850487,7.166004e-7,0.02381544,0.00003616036,0.02377473,0.00003112071,0.00008090932,0.000811246],"study_design_scores_gemma":[0.00303013,0.001118446,0.9486601,0.002021349,0.00004188023,0.000001031573,0.02225166,0.02070033,0.001830388,0.000008029287,0.00008417898,0.0002524955],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9970018,0.00006008781,0.000002089763,0.00005373477,0.00005946758,0.00228452,0.0001257707,0.00009577742,0.0003167748],"genre_scores_gemma":[0.9990695,0.000004880201,0.00006333292,0.00001531719,0.00002484157,0.0003236652,0.0002721683,0.00002896913,0.0001973783],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02194434,"threshold_uncertainty_score":0.5282894,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08945395266214314,"score_gpt":0.4480171033544907,"score_spread":0.3585631506923476,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}