{"id":"W4404274459","doi":"10.2196/62865","title":"Exploring the Credibility of Large Language Models for Mental Health Support: Protocol for a Scoping Review","year":2024,"lang":"en","type":"review","venue":"JMIR Research Protocols","topic":"Mental Health via Writing","field":"Psychology","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Universität Mannheim","keywords":"Preprint; Protocol (science); Mental health; Credibility; Computer science; Psychology; Data science; Applied psychology; Medicine; World Wide Web; Alternative medicine; Psychiatry; Political science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1561065,0.006887564,0.01735559,0.02372455,0.005820517,0.01009189,0.005788292,0.01089879,0.07111974],"category_scores_gemma":[0.2221383,0.006393592,0.0214741,0.0202135,0.007264934,0.01165266,0.009127176,0.009343427,0.01346263],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01909556,"about_ca_system_score_gemma":0.07802466,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007207802,"about_ca_topic_score_gemma":0.01427613,"domain_scores_codex":[0.9119656,0.03539913,0.03190413,0.006662938,0.01064726,0.003420927],"domain_scores_gemma":[0.8237906,0.07382967,0.03308762,0.01683011,0.04841778,0.004044271],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","study_design_scores_codex":[0.00549178,0.0003352718,0.0009622687,0.8830924,0.002439575,0.0010789,0.004428288,0.001568272,0.00179137,0.008165468,0.04099035,0.04965607],"study_design_scores_gemma":[0.01660682,0.001628959,0.004386213,0.7033517,0.007242164,0.0007036712,0.004632937,0.001903986,0.00269726,0.02130209,0.2348373,0.0007070104],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","genre_codex":"protocol","genre_gemma":"protocol","genre_scores_codex":[0.0002647106,0.00146657,0.001602947,0.0004547389,0.0003291438,0.9922439,0.003112197,0.00008538109,0.0004403641],"genre_scores_gemma":[0.0002392172,0.0005353414,0.002327201,0.0001310436,0.00001635106,0.9963211,0.0002731718,0.000008300651,0.0001483278],"genre_candidate":"protocol","genre_consensus":"protocol","teacher_disagreement_score":0.1561065,"threshold_uncertainty_score":0.8255797,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8629201304989632,"score_gpt":0.7571645648713037,"score_spread":0.1057555656276595,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}