{"id":"W3184031856","doi":"10.22215/etd/2021-14448","title":"Several Reinforcement Learning Methods in Mean-Field Games with Binary Action Spaces","year":2021,"lang":"en","type":"dissertation","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Carleton University","funders":"","keywords":"Reinforcement learning; Action (physics); Convergence (economics); Computer science; Binary number; Task (project management); Field (mathematics); Artificial intelligence; Population; Binary classification; Machine learning; Space (punctuation); Mathematical optimization; Mathematics; Engineering; Support vector machine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002492872,0.00108619,0.001346009,0.0009377536,0.0007035335,0.001141243,0.001648756,0.00188297,0.003663888],"category_scores_gemma":[0.006064215,0.0004818855,0.001288536,0.0007521778,0.001449361,0.001431532,0.001181665,0.00261576,0.0004333065],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001868299,"about_ca_system_score_gemma":0.001397082,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004831615,"about_ca_topic_score_gemma":0.003500876,"domain_scores_codex":[0.9991812,0.0003896853,0.00004173098,0.0001397186,0.0001743603,0.00007329249],"domain_scores_gemma":[0.9977673,0.001657141,0.000123681,0.0000662382,0.0002607702,0.0001249103],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007514303,0.0001236511,0.0006052118,0.0002438285,0.00008606782,0.00003996247,0.0001317665,0.7856351,0.0006354277,0.130029,0.002234047,0.08016076],"study_design_scores_gemma":[0.00001896294,0.00002665168,0.00006943947,0.00002062737,0.00001036194,0.00001075706,0.000007829401,0.9777057,0.0001356772,0.02094147,0.001044005,0.000008625755],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01081392,0.002722288,0.9772504,0.0008870094,0.0001937069,0.00009920245,0.00004598434,0.0001043545,0.007883099],"genre_scores_gemma":[0.5410171,0.004554409,0.4322387,0.000713071,0.0004231996,0.000673815,0.0001780818,0.0001644227,0.02003719],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004831615,"threshold_uncertainty_score":0.01355547,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02751152124695856,"score_gpt":0.3446213576646282,"score_spread":0.3171098364176697,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}