{"id":"W4403063608","doi":"10.2196/58418","title":"Aligning Large Language Models for Enhancing Psychiatric Interviews Through Symptom Delineation and Summarization: Pilot Study","year":2024,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Mental Health via Writing","field":"Psychology","cited_by":14,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Institute for Information and Communications Technology Promotion; Ministry of Science and ICT, South Korea; National Research Foundation of Korea; National Research Foundation","keywords":"Preprint; Automatic summarization; Psychology; Computer science; Natural language processing; World Wide Web","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003744035,0.0001643322,0.0002261405,0.0004026201,0.0005085783,0.000174862,0.0001813726,0.00006316256,0.0001558957],"category_scores_gemma":[0.00004701596,0.0001469901,0.0000403433,0.0008083237,0.00004128347,0.0008016031,0.0001800152,0.0004578807,0.0001423717],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001845943,"about_ca_system_score_gemma":0.00006286228,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002291738,"about_ca_topic_score_gemma":0.000339474,"domain_scores_codex":[0.9971722,0.0006700047,0.0006082145,0.000429734,0.0004487321,0.0006710645],"domain_scores_gemma":[0.9986749,0.0007011337,0.00007692345,0.0002525679,0.000198968,0.00009549087],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.0005607464,0.002231237,0.002037231,0.003984852,0.0002426837,0.00002939505,0.8032069,0.00002618803,0.0006577391,0.09902272,0.0181505,0.06984978],"study_design_scores_gemma":[0.008364409,0.02032651,0.005113296,0.002141423,0.00008936451,0.0000747684,0.6853092,0.2498041,0.0009109302,0.0151313,0.01163799,0.001096737],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6992289,0.005703612,0.2768199,0.0005399436,0.0008522923,0.004913626,0.0001121812,0.0002178375,0.01161179],"genre_scores_gemma":[0.9959329,0.00004672833,0.0008108733,0.0001115824,0.0003202985,0.0017302,0.00009472475,0.00004505435,0.000907579],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2967041,"threshold_uncertainty_score":0.5994081,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1496411742518138,"score_gpt":0.5207048682168024,"score_spread":0.3710636939649886,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}