{"id":"W2024074370","doi":"10.3166/ria.20.275-310","title":"Apprentissage par renforcement dans le cadre des processus décisionnels de Markov factorisés observables dans le désordre. Etude expérimentale du Q-Learning parallèle appliqué aux problèmes du labyrinthe et du New York Driving","year":2006,"lang":"fr","type":"article","venue":"Revue d intelligence artificielle","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Markov decision process; Observable; Architecture; Computer science; Markov chain; Partially observable Markov decision process; Humanities; Markov process; Artificial intelligence; Markov model; Mathematics; Physics; Machine learning; Philosophy; Art; Statistics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009750331,0.0005478206,0.0005537972,0.0002369602,0.000379343,0.0007307394,0.0005464952,0.0007203346,0.001553567],"category_scores_gemma":[0.003338154,0.0003322823,0.0003479062,0.0002250832,0.0007997223,0.001073301,0.0004629913,0.0008263253,0.0001815705],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009666691,"about_ca_system_score_gemma":0.000873054,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01473466,"about_ca_topic_score_gemma":0.008138643,"domain_scores_codex":[0.9995883,0.0001220766,0.00001624824,0.0001339789,0.00007910175,0.00006026491],"domain_scores_gemma":[0.9986325,0.0007715085,0.0001333649,0.0001583424,0.0001867417,0.0001175158],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000512064,0.000222773,0.002255849,0.00005792844,0.00004297567,0.0001203989,0.0001720196,0.9103504,0.02707312,0.006790704,0.0002477398,0.05215392],"study_design_scores_gemma":[0.0000193161,0.00007911585,0.0003827628,0.000001356296,0.000004576444,0.00001089631,0.00001106377,0.9934753,0.004651247,0.00117657,0.0001827322,0.000004997019],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6734592,0.0001449911,0.3236797,0.000129186,0.00003405589,0.00006832625,0.00004325926,0.0006587832,0.00178253],"genre_scores_gemma":[0.9679354,0.00003718543,0.03089899,0.00001185172,0.000003690338,0.00002800401,0.00002447582,0.00002126985,0.001039184],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01473466,"threshold_uncertainty_score":0.02929777,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03862456106017156,"score_gpt":0.2586800958815554,"score_spread":0.2200555348213838,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}