{"id":"W3012442074","doi":"10.1109/cdc40024.2019.9029788","title":"Q-Learning with Side Information in Multi-Agent Finite Games","year":2019,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Human–computer interaction","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00314332,0.0007963625,0.001557113,0.0003358717,0.0004179568,0.0007706599,0.001546023,0.001152203,0.001133512],"category_scores_gemma":[0.007407132,0.0004612489,0.0004513724,0.0003312963,0.001880725,0.001571588,0.001469309,0.001497154,0.0001906551],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009728205,"about_ca_system_score_gemma":0.001300188,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002511145,"about_ca_topic_score_gemma":0.001658896,"domain_scores_codex":[0.9987493,0.0006970268,0.00004936067,0.0001714771,0.0002238117,0.00010896],"domain_scores_gemma":[0.9950335,0.003837154,0.0003095713,0.0002311303,0.0003844984,0.0002040593],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007317688,0.00004622242,0.0003453091,0.00005891086,0.00003072278,0.00007475408,0.00005372511,0.957153,0.0007127117,0.02920162,0.000211671,0.01203818],"study_design_scores_gemma":[0.00001043728,0.00001991237,0.00001940018,0.00000282198,0.000002335398,0.000005566385,0.000002181088,0.9909402,0.0001107699,0.008804475,0.00007942693,0.000002442793],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02262837,0.0001864573,0.9755028,0.0001774534,0.00002879826,0.00003742575,0.00001236414,0.00007894679,0.00134748],"genre_scores_gemma":[0.9198246,0.000173728,0.0778687,0.0001458496,0.0000353482,0.0001460265,0.00002747019,0.00002531286,0.001753019],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.00314332,"threshold_uncertainty_score":0.01662368,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01350555464671978,"score_gpt":0.2289392024984458,"score_spread":0.215433647851726,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}