{"id":"W4396827245","doi":"10.1145/3613905.3651891","title":"Conversational AI in health: Design considerations from a Wizard-of-Oz dermatology case study with users, clinicians and a medical LLM","year":2024,"lang":"en","type":"article","venue":"","topic":"Digital Mental Health Interventions","field":"Psychology","cited_by":20,"is_retracted":false,"has_abstract":true,"ca_institutions":"Google (Canada); McMaster University; University of Toronto","funders":"","keywords":"Wizard of oz; Conversation; Empathy; Computer science; Health care; Dialog system; Chatbot; Coding (social sciences); Medical education; Medicine; Human–computer interaction; Psychology; World Wide Web; Communication","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03797774,0.00107467,0.0008265789,0.00122441,0.007146307,0.006410451,0.003019439,0.002784078,0.006973457],"category_scores_gemma":[0.05137014,0.0007993733,0.0007251626,0.0007926241,0.004755965,0.004552938,0.005212497,0.002331185,0.001040434],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003698766,"about_ca_system_score_gemma":0.003937441,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00356987,"about_ca_topic_score_gemma":0.008276661,"domain_scores_codex":[0.961859,0.03380847,0.001178865,0.0009060602,0.001137504,0.001110217],"domain_scores_gemma":[0.927953,0.06215111,0.001472118,0.001623922,0.00360228,0.003197538],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.003001526,0.006238566,0.01553143,0.005033428,0.0001198286,0.00440358,0.8462923,0.001783706,0.01287912,0.009026316,0.004044557,0.09164561],"study_design_scores_gemma":[0.002654506,0.009537037,0.01554434,0.002364786,0.0004031956,0.00210559,0.8677021,0.007510849,0.01127188,0.00963679,0.07095288,0.0003160175],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9275477,0.0007725189,0.04210937,0.006347181,0.0002376912,0.01192557,0.0003209827,0.0002271719,0.01051176],"genre_scores_gemma":[0.8814539,0.0008531166,0.08496874,0.002249283,0.00008996518,0.02644417,0.0001934035,0.0001039621,0.003643508],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03797774,"threshold_uncertainty_score":0.2008479,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.106710980531109,"score_gpt":0.4556503721868528,"score_spread":0.3489393916557438,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}