{"id":"W2161677453","doi":"10.1109/ical.2008.4636228","title":"Q-learning based multi-robot box-pushing with minimal switching of actions","year":2008,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Robot; Computer science; Reinforcement learning; Action (physics); Robot learning; Artificial intelligence; Mobile robot","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002196168,0.0001580314,0.0001926249,0.0001744451,0.0003656719,0.00007141663,0.0005589509,0.00005429448,0.00003288695],"category_scores_gemma":[0.0001309813,0.0001323107,0.00006550545,0.0004295646,0.00004238225,0.0006205364,0.0001394789,0.0003539995,0.00002633526],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004129552,"about_ca_system_score_gemma":0.0001407211,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00009331562,"about_ca_topic_score_gemma":0.00001075711,"domain_scores_codex":[0.9986134,0.00006970988,0.0002937426,0.0003001278,0.000412156,0.0003108477],"domain_scores_gemma":[0.9989334,0.0002342922,0.0002136076,0.0004110868,0.0001164911,0.00009112303],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000007502169,0.00003507851,0.01392735,0.0000127461,0.00001799836,0.00001606472,0.0009659271,0.978277,0.005718401,0.0005094582,0.00003281499,0.0004796936],"study_design_scores_gemma":[0.0006238437,0.0002755726,0.01216726,0.00005082899,0.000007412925,0.00003696707,0.0001468789,0.9787438,0.00726043,0.000001718715,0.0004912786,0.0001940293],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04408523,0.000005805678,0.9522455,0.0002075495,0.0001064412,0.0001055923,6.992807e-8,0.0002795548,0.002964236],"genre_scores_gemma":[0.6161852,0.000002023573,0.3830064,0.0000841404,0.00001391745,0.000003278259,8.006012e-7,0.0000103275,0.0006939181],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.5721,"threshold_uncertainty_score":0.5395475,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04728716757252466,"score_gpt":0.2631881779501734,"score_spread":0.2159010103776487,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}