{"id":"W4411993048","doi":"10.1016/j.jss.2025.112541","title":"LLMs and Stack Overflow discussions: Reliability, impact, and challenges","year":2025,"lang":"en","type":"article","venue":"Journal of Systems and Software","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Polytechnique Montréal","funders":"Fonds de recherche du Québec; Natural Sciences and Engineering Research Council of Canada; Canada Research Chairs; Canadian Institute for Advanced Research","keywords":"Stack (abstract data type); Reliability (semiconductor); Computer science; Reliability engineering; Political science; Computer security; Engineering; Operating system; Physics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06190887,0.0008174228,0.0007961316,0.005470769,0.004179345,0.008846698,0.001919349,0.002976338,0.004361276],"category_scores_gemma":[0.3458784,0.0009710302,0.0008062791,0.003250195,0.004787943,0.0150428,0.007216433,0.003214221,0.001552038],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003979203,"about_ca_system_score_gemma":0.004674391,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00476563,"about_ca_topic_score_gemma":0.004103638,"domain_scores_codex":[0.9388513,0.04300976,0.003025114,0.003403885,0.009855877,0.001854087],"domain_scores_gemma":[0.5079249,0.3946363,0.03958637,0.02383781,0.02279565,0.01121891],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001590192,0.0007294783,0.3590489,0.001759112,0.0002232403,0.0007980917,0.3118728,0.001652908,0.004221742,0.009878383,0.01786707,0.2903582],"study_design_scores_gemma":[0.0004145757,0.003297968,0.4329281,0.003810283,0.0005022545,0.001530407,0.3014582,0.04285096,0.0104999,0.04977664,0.1518327,0.001098025],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9553841,0.001531498,0.01273537,0.01398268,0.0002753371,0.0003772971,0.0005452298,0.002371675,0.01279675],"genre_scores_gemma":[0.9882724,0.0003533415,0.006758518,0.00149033,0.0002257628,0.0002576117,0.0003369013,0.0003988085,0.001906437],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.06190887,"threshold_uncertainty_score":0.3274093,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1051350801235757,"score_gpt":0.406944567029956,"score_spread":0.3018094869063803,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}