{"id":"W1985646234","doi":"10.1115/imece2007-41643","title":"A Modified Q-Learning Algorithm for Multi-Robot Decision Making","year":2007,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Robot; Computer science; Q-learning; Markov decision process; Artificial intelligence; Algorithm; Kalman filter; Robot learning; Domain (mathematical analysis); Markov chain; Reinforcement learning; Markov process; Machine learning; Mobile robot; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002844039,0.001076421,0.001405788,0.000669419,0.0007216532,0.001083434,0.002555532,0.002008582,0.004937784],"category_scores_gemma":[0.007320062,0.0004816249,0.0008223919,0.0008512358,0.001209027,0.00173846,0.001495668,0.002273626,0.001035689],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001078435,"about_ca_system_score_gemma":0.002217447,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004502969,"about_ca_topic_score_gemma":0.002669226,"domain_scores_codex":[0.9980508,0.0006994666,0.0001215451,0.0004431322,0.0005308709,0.0001541855],"domain_scores_gemma":[0.9963689,0.002236511,0.0002321125,0.0002199167,0.0008178186,0.0001248609],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001265473,0.00009882555,0.000867978,0.0001502084,0.00007531621,0.0001068643,0.0001265225,0.7611266,0.002068452,0.03124841,0.002235039,0.2017692],"study_design_scores_gemma":[0.00002450886,0.00004299085,0.00005963767,0.000006544624,0.000005380977,0.000022442,0.000004854632,0.9920082,0.0003483712,0.006374679,0.00109553,0.000006771681],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001255305,0.0001108783,0.9977012,0.00008562174,0.00004459646,0.00004227184,0.000009036659,0.0001004677,0.0006506765],"genre_scores_gemma":[0.2682444,0.0003415884,0.7261795,0.0003433156,0.0001578314,0.0005284455,0.0001145384,0.00008593832,0.004004478],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004937784,"threshold_uncertainty_score":0.01651859,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05076914814580656,"score_gpt":0.3375238673067552,"score_spread":0.2867547191609486,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}