{"id":"W4404274459","doi":"10.2196/62865","title":"Exploring the Credibility of Large Language Models for Mental Health Support: Protocol for a Scoping Review","year":2024,"lang":"en","type":"review","venue":"JMIR Research Protocols","topic":"Mental Health via Writing","field":"Psychology","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Universität Mannheim","keywords":"Preprint; Protocol (science); Mental health; Credibility; Computer science; Psychology; Data science; Applied psychology; Medicine; World Wide Web; Alternative medicine; Psychiatry; Political science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.024875,0.00063981,0.002807629,0.0004028555,0.0006701034,0.0001124314,0.001432302,0.0002513584,0.000475231],"category_scores_gemma":[0.0004078859,0.0004187668,0.001046879,0.0009818043,0.0002073967,0.0002719478,0.0007394466,0.001696836,0.0001291136],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008197108,"about_ca_system_score_gemma":0.003202761,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0000440322,"about_ca_topic_score_gemma":0.00004367438,"domain_scores_codex":[0.9888711,0.003122248,0.003118478,0.001454848,0.001203044,0.002230278],"domain_scores_gemma":[0.9945808,0.001738074,0.001064103,0.001882901,0.0003517513,0.0003823456],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001536738,0.0003562921,1.429422e-7,0.6323611,0.00004963525,0.000003027124,0.001007989,1.408374e-8,1.095254e-7,0.001607724,0.05415332,0.310307],"study_design_scores_gemma":[0.0008374706,0.001092406,5.723581e-8,0.479056,0.00001420443,0.00001126295,0.0002219475,0.00001013967,0.000001447753,0.0001206691,0.5184738,0.0001606396],"study_design_candidate":"systematic_review","study_design_consensus":null,"genre_codex":"protocol","genre_gemma":"protocol","genre_scores_codex":[9.682908e-9,0.31321,0.00006851628,0.0004805824,0.00003825286,0.6843833,0.001209342,0.00008118935,0.0005288638],"genre_scores_gemma":[1.192172e-8,0.138971,0.0003853705,0.0002042981,0.0004818309,0.8586517,0.0002118831,0.0002167029,0.0008771988],"genre_candidate":"protocol","genre_consensus":"protocol","teacher_disagreement_score":0.4643205,"threshold_uncertainty_score":0.9998264,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8629201304989632,"score_gpt":0.7571645648713037,"score_spread":0.1057555656276595,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}