{"id":"W4416154989","doi":"10.2196/80371","title":"Influence of Topic Familiarity and Prompt Specificity on Citation Fabrication in Mental Health Research Using Large Language Models: Experimental Study","year":2025,"lang":"en","type":"article","venue":"JMIR Mental Health","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Citation; Mental health; Reliability (semiconductor); Human health; Citation analysis; Psychological intervention","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.09867887,0.0014719,0.002250957,0.002614757,0.002562694,0.006710179,0.002808969,0.003118911,0.01319431],"category_scores_gemma":[0.5014601,0.001801248,0.004224706,0.002730184,0.003864332,0.008718737,0.006628322,0.003603826,0.001876634],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002568423,"about_ca_system_score_gemma":0.003798486,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001376143,"about_ca_topic_score_gemma":0.001258747,"domain_scores_codex":[0.891421,0.06751664,0.01803942,0.01155625,0.009097432,0.002369374],"domain_scores_gemma":[0.1703114,0.731181,0.06265748,0.02499155,0.008232467,0.002626114],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.1664469,0.06017719,0.4608924,0.01506115,0.005751053,0.001712825,0.0883925,0.01660114,0.02236108,0.01090193,0.006049626,0.1456523],"study_design_scores_gemma":[0.0439195,0.1718916,0.5292976,0.004891474,0.01837751,0.002135868,0.0221069,0.1068185,0.02468316,0.05450946,0.01918171,0.002186657],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9733117,0.0005556888,0.01278725,0.0004459912,0.000143943,0.00760868,0.0006645696,0.0002661829,0.004215857],"genre_scores_gemma":[0.9502617,0.0002970509,0.02465865,0.0005512678,0.000176656,0.02132048,0.0007604626,0.0001672568,0.001806456],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9968811,"threshold_uncertainty_score":0.52187,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.7297054509316665,"score_gpt":0.6359743937937483,"score_spread":0.09373105713791818,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}