{"id":"W4399686980","doi":"10.1007/s10664-024-10500-5","title":"Common challenges of deep reinforcement learning applications development: an empirical study","year":2024,"lang":"en","type":"article","venue":"Empirical Software Engineering","topic":"Software Engineering Research","field":"Computer Science","cited_by":13,"is_retracted":false,"has_abstract":false,"ca_institutions":"Polytechnique Montréal","funders":"Fonds de recherche du Québec; Canadian Institute for Advanced Research","keywords":"Computer science; Taxonomy (biology); Leverage (statistics); Popularity; Reinforcement learning; Artificial intelligence; Data science; Software engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01079075,0.0003709958,0.0003544012,0.001052881,0.001110226,0.002402581,0.001315912,0.001516448,0.002389452],"category_scores_gemma":[0.1224396,0.0003613032,0.0002892372,0.001268895,0.001417933,0.004202162,0.002246025,0.00237396,0.0005556737],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001731565,"about_ca_system_score_gemma":0.002565098,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002612424,"about_ca_topic_score_gemma":0.003532874,"domain_scores_codex":[0.9903364,0.004499134,0.0006255725,0.001019857,0.002989996,0.0005290202],"domain_scores_gemma":[0.8204725,0.134903,0.01322461,0.01264636,0.01495852,0.003794975],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00181564,0.006771544,0.4849391,0.0009673737,0.0001854791,0.0012109,0.0159456,0.03047527,0.007406957,0.02877593,0.0109084,0.4105978],"study_design_scores_gemma":[0.0003611666,0.004829712,0.3836811,0.0009696836,0.0002445172,0.002559674,0.03080963,0.4510855,0.01618576,0.06619454,0.04282111,0.0002576916],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.987041,0.0003118665,0.00679436,0.0009836364,0.00001869748,0.0001066572,0.00008206598,0.00009118264,0.00457047],"genre_scores_gemma":[0.9960871,0.0001010447,0.002775226,0.0000744711,0.000007262242,0.00004046179,0.00008242083,0.00002217557,0.0008098534],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9892092,"threshold_uncertainty_score":0.05706763,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03930345304508256,"score_gpt":0.3277676583422513,"score_spread":0.2884642052971688,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}