{"id":"W4395689022","doi":"10.2196/56569","title":"The Role of Humanization and Robustness of Large Language Models in Conversational Artificial Intelligence for Individuals With Depression: A Critical Analysis","year":2024,"lang":"en","type":"article","venue":"JMIR Mental Health","topic":"Mental Health via Writing","field":"Psychology","cited_by":44,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Psychology; Robustness (evolution); Artificial intelligence; Computer science; Psychotherapist; Cognitive psychology; Biology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007893199,0.00007643038,0.000192474,0.0001621885,0.0001325416,0.00001594106,0.00007223561,0.00004778319,0.00007237295],"category_scores_gemma":[0.00001161749,0.00005830287,0.0000299633,0.0004050737,0.0000908964,0.00008584112,0.00003116093,0.00009487221,8.15563e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00007067052,"about_ca_system_score_gemma":0.00007652245,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002059967,"about_ca_topic_score_gemma":0.000635398,"domain_scores_codex":[0.998746,0.0001324995,0.000466742,0.0002210579,0.0001980307,0.0002356663],"domain_scores_gemma":[0.9993039,0.0003902113,0.00009990145,0.0001114311,0.00003386498,0.00006067045],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007672835,0.0008360547,0.05557436,0.00181455,0.0002609235,0.000003852891,0.0742415,0.0009100594,0.0001331255,0.7803198,0.0001313267,0.08500722],"study_design_scores_gemma":[0.001147198,0.001165785,0.04114865,0.001237035,0.0001531674,0.00002984469,0.2032376,0.7333726,0.002431015,0.01544068,0.0002684025,0.0003680877],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9740705,0.003908777,0.01932091,0.0008585035,0.000134474,0.001128376,0.0003699753,0.00002040921,0.0001880221],"genre_scores_gemma":[0.9985554,0.00001329533,0.001063579,0.00005837735,0.00003724133,0.0001468461,0.00009805792,0.00001096314,0.00001627989],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.764879,"threshold_uncertainty_score":0.2377522,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03596799441104494,"score_gpt":0.4235083774749664,"score_spread":0.3875403830639215,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}