{"id":"W2161677453","doi":"10.1109/ical.2008.4636228","title":"Q-learning based multi-robot box-pushing with minimal switching of actions","year":2008,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Robot; Computer science; Reinforcement learning; Action (physics); Robot learning; Artificial intelligence; Mobile robot","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001817255,0.0007252718,0.001379924,0.0003156984,0.0004171507,0.000546227,0.001660522,0.0009883902,0.001743917],"category_scores_gemma":[0.003668624,0.0003675053,0.0004167401,0.0002833172,0.001156156,0.000784281,0.001065102,0.0009989475,0.0002638481],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005398482,"about_ca_system_score_gemma":0.001195034,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002597239,"about_ca_topic_score_gemma":0.001279479,"domain_scores_codex":[0.9992598,0.0002387619,0.00004770018,0.0001629363,0.0001892745,0.0001015421],"domain_scores_gemma":[0.9975231,0.001481346,0.0003010426,0.0001737635,0.0003471949,0.0001734481],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002852529,0.0002104485,0.0008375419,0.0001159612,0.00006744696,0.0001650538,0.0001255186,0.8752543,0.006958076,0.01028236,0.0006540801,0.105044],"study_design_scores_gemma":[0.00003433883,0.0000837719,0.00008067145,0.000003232475,0.000004572859,0.00001562285,0.000002687761,0.9972451,0.0008426091,0.001522187,0.0001597746,0.000005610179],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0355826,0.0001001483,0.96243,0.0001191804,0.00004161993,0.0001096965,0.00001450606,0.000491634,0.001110636],"genre_scores_gemma":[0.8423811,0.00005313042,0.1555654,0.0001079014,0.00002219191,0.0002251299,0.00003509926,0.00003721609,0.001572874],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.002597239,"threshold_uncertainty_score":0.009610713,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04728716757252466,"score_gpt":0.2631881779501734,"score_spread":0.2159010103776487,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}