{"id":"W4402596039","doi":"10.21203/rs.3.rs-4314484/v1","title":"On-policy Actor-Critic Reinforcement Learning for Multi-UAV Exploration","year":2024,"lang":"en","type":"preprint","venue":"Research Square","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Regina","funders":"","keywords":"Reinforcement learning; Policy learning; Computer science; Reinforcement; Artificial intelligence; Psychology; Social psychology; Machine learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","scholarly_communication","research_integrity","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.002846865,0.0004898852,0.000444851,0.001748902,0.0006441653,0.002051524,0.002200209,0.0004411205,0.00003916281],"category_scores_gemma":[0.004202032,0.0004791894,0.0003396985,0.001021405,0.0001360649,0.0004131609,0.00530884,0.003923276,0.0009174441],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001289324,"about_ca_system_score_gemma":0.001482389,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001306912,"about_ca_topic_score_gemma":0.00000701592,"domain_scores_codex":[0.9937648,0.000553885,0.0006897235,0.001333726,0.0023118,0.001346089],"domain_scores_gemma":[0.9955704,0.001179446,0.0001821489,0.001656175,0.001090778,0.0003210884],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0000209237,0.00003792173,0.000008435207,0.001801295,0.00006239308,0.00001948019,0.001838867,0.8309774,0.00006381376,0.1582251,0.002435415,0.004508956],"study_design_scores_gemma":[0.0004601771,0.0008375869,0.0000257683,0.00167521,0.00001098545,0.000001712992,0.0002402785,0.9671932,0.0004935893,0.01841774,0.01019225,0.000451516],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0003333955,0.0002475957,0.9883301,0.003177447,0.001051813,0.002725117,0.000007030704,0.000654397,0.00347314],"genre_scores_gemma":[0.9497731,0.0004201233,0.02294371,0.0001624391,0.001072366,0.001988318,0.0002990615,0.0001476181,0.02319323],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9653863,"threshold_uncertainty_score":0.9998605,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1819195764200979,"score_gpt":0.4539249079263171,"score_spread":0.2720053315062193,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}