{"id":"W4415230584","doi":"10.1609/aies.v8i2.36651","title":"Write on Paper, Wrong in Practice: Why LLMs Still Struggle with Writing Clinical Notes","year":2025,"lang":"en","type":"article","venue":"Proceedings of the AAAI/ACM Conference on AI Ethics and Society","topic":"Legal Education and Practice Innovations","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Guelph; University of Prince Edward Island","funders":"Mitacs","keywords":"Sociotechnical system; Documentation; Technical writing; Bespoke; Qualitative research; Technical documentation","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03263942,0.0005120531,0.0006413925,0.002132173,0.01357211,0.01301498,0.003231457,0.004721714,0.006194619],"category_scores_gemma":[0.2068269,0.001396388,0.0006391329,0.002216103,0.01509679,0.01130488,0.01043845,0.006217885,0.002751515],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0154579,"about_ca_system_score_gemma":0.0341211,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.04261113,"about_ca_topic_score_gemma":0.07010937,"domain_scores_codex":[0.9467239,0.02628857,0.004969851,0.003686449,0.01381439,0.004516806],"domain_scores_gemma":[0.8353046,0.08627195,0.02657513,0.008073876,0.02529114,0.01848335],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.0001006904,0.0000820269,0.02924751,0.0004629257,0.00002907819,0.005033316,0.8736377,0.000137394,0.001261785,0.003785801,0.0265163,0.05970545],"study_design_scores_gemma":[0.00003725389,0.0001217505,0.0133373,0.001335715,0.0000250809,0.005376279,0.8479801,0.0008169535,0.0007611841,0.004917882,0.1251433,0.000147153],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7739435,0.006044386,0.01844783,0.1679445,0.001521106,0.0003245186,0.0002559796,0.0007416749,0.03077648],"genre_scores_gemma":[0.9617743,0.002215156,0.008995877,0.01567561,0.0002073301,0.0001991581,0.0001181897,0.0004099091,0.01040443],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.04261113,"threshold_uncertainty_score":0.1726159,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.122319563470876,"score_gpt":0.4663468857142978,"score_spread":0.3440273222434218,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}