{"id":"W4403129964","doi":"10.1093/bjd/ljae377","title":"Do large language model chatbots perform better than established patient information resources in answering patient questions? A comparative study on melanoma","year":2024,"lang":"en","type":"article","venue":"British Journal of Dermatology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":19,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Les Laboratories Pierre Fabre; Bristol-Myers Squibb Canada; Bristol-Myers Squibb","keywords":"Readability; Medicine; Computer science","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002172354,0.000105326,0.0003169518,0.0004245606,0.00008668495,0.000116035,0.00006586676,0.00008727081,0.00003054094],"category_scores_gemma":[0.0001147125,0.0001022196,0.00006231015,0.0002170363,0.00002862421,0.000545,0.00002296963,0.0004938072,0.00002201267],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001406,"about_ca_system_score_gemma":0.0001413455,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002710383,"about_ca_topic_score_gemma":0.0003044153,"domain_scores_codex":[0.9984292,0.0001241371,0.0008318622,0.0001170326,0.0002673731,0.0002304348],"domain_scores_gemma":[0.9993147,0.0001004915,0.0001829536,0.0001006969,0.0001997342,0.0001013773],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.0006583757,0.001691475,0.1469613,0.0002791939,0.0001383997,0.004480331,0.5049231,0.0007726604,0.00009110998,0.0001339288,0.003754162,0.3361159],"study_design_scores_gemma":[0.001725717,0.006977723,0.1817091,0.008180175,0.0002414923,0.05133596,0.6451777,0.08856003,0.00940572,0.001031034,0.004850112,0.000805276],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9959413,0.001332409,0.0002466446,0.001282801,0.0004028709,0.0003830178,0.00001099885,0.00002047036,0.0003794349],"genre_scores_gemma":[0.9992087,0.00007210923,0.0001708356,0.0004219961,0.0000759972,0.00002340277,0.00001387356,0.000008707586,0.00000434163],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3353106,"threshold_uncertainty_score":0.4168395,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04760364842800911,"score_gpt":0.3650601324547645,"score_spread":0.3174564840267554,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}