{"id":"W2024074370","doi":"10.3166/ria.20.275-310","title":"Apprentissage par renforcement dans le cadre des processus décisionnels de Markov factorisés observables dans le désordre. Etude expérimentale du Q-Learning parallèle appliqué aux problèmes du labyrinthe et du New York Driving","year":2006,"lang":"fr","type":"article","venue":"Revue d intelligence artificielle","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Markov decision process; Observable; Architecture; Computer science; Markov chain; Partially observable Markov decision process; Humanities; Markov process; Artificial intelligence; Markov model; Mathematics; Physics; Machine learning; Philosophy; Art; Statistics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.002086132,0.0009756104,0.0008261098,0.0002214426,0.002347944,0.001470481,0.002599692,0.0004082778,0.000407747],"category_scores_gemma":[0.0004749902,0.001082805,0.0004037705,0.00130325,0.0007715769,0.001604444,0.001313331,0.001043052,0.0003288238],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006416522,"about_ca_system_score_gemma":0.001090689,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01369773,"about_ca_topic_score_gemma":0.001332021,"domain_scores_codex":[0.9930614,0.0007172507,0.001780996,0.001615865,0.0009254714,0.001899023],"domain_scores_gemma":[0.9962518,0.0006679997,0.0009292401,0.001303966,0.0003366444,0.0005103625],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003248359,0.0005682893,0.05966366,0.000389217,0.00009604753,0.0001020793,0.02577885,0.8680281,0.008356716,0.02613583,0.003268732,0.007579976],"study_design_scores_gemma":[0.0003226954,0.0004110228,0.003184273,0.001214825,0.00008502345,0.0001427761,0.01589441,0.8352877,0.1155581,0.002440006,0.02432408,0.001135042],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1401872,0.00219386,0.8462477,0.002129212,0.0008609752,0.001175957,0.000006713515,0.0004229232,0.006775459],"genre_scores_gemma":[0.906325,0.0008518247,0.04016941,0.00009186957,0.0005909174,0.0001585459,0.00007368885,0.0001442161,0.05159455],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8060783,"threshold_uncertainty_score":0.9995661,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03862456106017156,"score_gpt":0.2586800958815554,"score_spread":0.2200555348213838,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}