{"id":"W4391494285","doi":"10.1007/s13042-023-02063-6","title":"Expected Lenient Q-learning: a fast variant of the Lenient Q-learning algorithm for cooperative stochastic Markov games","year":2024,"lang":"en","type":"article","venue":"International Journal of Machine Learning and Cybernetics","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":false,"ca_institutions":"Université du Québec à Rimouski","funders":"Centre National pour la Recherche Scientifique et Technique","keywords":"Algorithm; Convergence (economics); Reinforcement learning; Markov chain; Computer science; Q-learning; Rate of convergence; Artificial intelligence; Markov decision process; Mathematics; Markov process; Machine learning; Key (lock)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005183722,0.001399465,0.002344094,0.001096196,0.0008736814,0.001574676,0.004196374,0.002375793,0.008748724],"category_scores_gemma":[0.01558007,0.0008025006,0.0008165435,0.001095256,0.002151423,0.002645798,0.004002866,0.003606678,0.001701688],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001785639,"about_ca_system_score_gemma":0.003404706,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006754462,"about_ca_topic_score_gemma":0.005878206,"domain_scores_codex":[0.9981311,0.0007823925,0.0000974576,0.000277883,0.0004775473,0.0002336914],"domain_scores_gemma":[0.9923711,0.005172783,0.0003250652,0.0005930639,0.001125164,0.0004128159],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004006005,0.0002193658,0.000982182,0.0001555476,0.00007675683,0.0001122088,0.0001483572,0.770627,0.001204052,0.06613795,0.004506506,0.1554294],"study_design_scores_gemma":[0.00002152973,0.00002253391,0.00002826884,0.00000531135,0.00000304483,0.000009688166,0.0000037092,0.9904461,0.00015426,0.00904129,0.0002599272,0.000004402928],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.00413488,0.00009452446,0.9939779,0.0001429057,0.00005948498,0.0000774598,0.00002500572,0.0004617621,0.001026024],"genre_scores_gemma":[0.383566,0.0002300905,0.6061277,0.0006341253,0.0001590574,0.0006730127,0.0002829223,0.0004908016,0.007836296],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.008748724,"threshold_uncertainty_score":0.02926737,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.007476805942429175,"score_gpt":0.2578004923334482,"score_spread":0.250323686391019,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}