{"id":"W4367016230","doi":"10.1109/tse.2023.3269804","title":"A Search-Based Testing Approach for Deep Reinforcement Learning Agents","year":2023,"lang":"en","type":"article","venue":"IEEE Transactions on Software Engineering","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":46,"is_retracted":false,"has_abstract":true,"ca_institutions":"Cisco Systems (Canada); École de Technologie Supérieure; University of Ottawa","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Reinforcement learning; Artificial intelligence; Machine learning; Software testing; Software engineering; Programming language; Software","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002716394,0.001153207,0.00134235,0.000852665,0.000588631,0.001008188,0.00287404,0.001785,0.002613298],"category_scores_gemma":[0.01149043,0.0006407743,0.0008282926,0.0004088538,0.002061137,0.001743873,0.001849746,0.001808221,0.0003677364],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001569488,"about_ca_system_score_gemma":0.00260256,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006458457,"about_ca_topic_score_gemma":0.004909819,"domain_scores_codex":[0.998023,0.0007338246,0.0001201682,0.0003591236,0.0004643014,0.0002995104],"domain_scores_gemma":[0.9933891,0.004184209,0.0005572683,0.0004623498,0.001005976,0.0004010069],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001601984,0.0001419586,0.001919547,0.00008650802,0.00005268467,0.0001695513,0.0001013724,0.9290398,0.002476456,0.0173377,0.0008314451,0.04768268],"study_design_scores_gemma":[0.00001472019,0.00003803186,0.00004635661,0.000004846043,0.00000452049,0.00001113942,0.000006029025,0.9954067,0.0003765346,0.003916678,0.0001709159,0.000003590635],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04858564,0.0003204278,0.9451978,0.0005923502,0.00005674077,0.0001558735,0.00006094163,0.001700051,0.003330145],"genre_scores_gemma":[0.8344012,0.0001019609,0.1625242,0.0003465291,0.00003111531,0.0002359722,0.0001053322,0.0001309125,0.002122773],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006458457,"threshold_uncertainty_score":0.01436585,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04544628432889011,"score_gpt":0.2572917273298779,"score_spread":0.2118454430009878,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}