{"id":"W4403866520","doi":"10.1002/jso.27966","title":"Assessment of Artificial Intelligence Chatbot Responses to Common Patient Questions on Bone Sarcoma","year":2024,"lang":"en","type":"article","venue":"Journal of Surgical Oncology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Calgary","funders":"National Institute of Arthritis and Musculoskeletal and Skin Diseases","keywords":"Readability; Medicine; Likert scale; Empathy; Relevance (law); Artificial intelligence; Psychology; Computer science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02028707,0.0006632203,0.0006024021,0.002197461,0.0006462067,0.001253381,0.0006930395,0.001055061,0.003257855],"category_scores_gemma":[0.1046064,0.0002423285,0.0006541932,0.0008541563,0.0006705726,0.0009534273,0.00268058,0.0009936491,0.0006515227],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001389463,"about_ca_system_score_gemma":0.0008733939,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007739872,"about_ca_topic_score_gemma":0.001042762,"domain_scores_codex":[0.9835001,0.01117485,0.001812431,0.0008167038,0.001975539,0.0007203078],"domain_scores_gemma":[0.8654464,0.1054563,0.01405732,0.001944622,0.01048981,0.002605427],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.004587823,0.002507754,0.5830963,0.002666919,0.0003945718,0.001230039,0.14415,0.004016942,0.01410397,0.0009465186,0.006592787,0.2357063],"study_design_scores_gemma":[0.0002856799,0.007652637,0.8797627,0.0009551868,0.0002321013,0.001153095,0.06811296,0.01992369,0.00955175,0.001226408,0.01088701,0.0002567085],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9949809,0.00006633805,0.002169291,0.0002119312,0.00003051584,0.0004716693,0.0002145327,0.0001145079,0.001740384],"genre_scores_gemma":[0.9898376,0.0001100265,0.006941639,0.0002536387,0.00002225265,0.001298424,0.0004250351,0.00002596913,0.001085188],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02028707,"threshold_uncertainty_score":0.1072896,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1801518825300124,"score_gpt":0.51038109222645,"score_spread":0.3302292096964376,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}