{"id":"W185706336","doi":"","title":"Labeled Initialized Adaptive Play Q-learning for Stochastic Games","year":2007,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université Laval","funders":"","keywords":"Q-learning; Computer science; Context (archaeology); Process (computing); Artificial intelligence; Optimal stopping; Point (geometry); Mathematical optimization; Adaptive learning; Grid; Quality (philosophy); Mathematics; Reinforcement learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004413687,0.00118916,0.001172053,0.0006901244,0.0007515054,0.001294785,0.00204414,0.001293635,0.002856724],"category_scores_gemma":[0.0156569,0.0005361486,0.0005235745,0.0005786441,0.002834573,0.001917713,0.001587046,0.002444875,0.0004382448],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002046217,"about_ca_system_score_gemma":0.001855391,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003549172,"about_ca_topic_score_gemma":0.002590759,"domain_scores_codex":[0.9977002,0.001444036,0.00008892144,0.0002899453,0.00032486,0.0001520358],"domain_scores_gemma":[0.991545,0.006517762,0.000546781,0.0003520384,0.000745529,0.0002929186],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001668951,0.0001050128,0.00111899,0.0001403807,0.00004826897,0.0001093133,0.0002165503,0.7336448,0.001264497,0.2180101,0.001402318,0.04377291],"study_design_scores_gemma":[0.00001624354,0.00003429146,0.00004223727,0.000007509867,0.000003272721,0.000007691728,0.000005610642,0.9695455,0.0002579391,0.02973291,0.000341433,0.000005281408],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.004565822,0.00008814366,0.9943337,0.0000984354,0.00001371166,0.00005021469,0.000009064719,0.00007964027,0.0007612998],"genre_scores_gemma":[0.5434899,0.000317771,0.4509,0.0002681192,0.00006610962,0.0007494056,0.0001115607,0.0001127864,0.003984488],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004413687,"threshold_uncertainty_score":0.02334207,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0278985086208105,"score_gpt":0.2864012359353325,"score_spread":0.258502727314522,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}