{"id":"W2161717678","doi":"","title":"MDPs with Non-Deterministic Policies.","year":2009,"lang":"en","type":"article","venue":"PubMed","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Computer science; Markov decision process; Flexibility (engineering); Context (archaeology); Mathematical optimization; Optimal decision; Integer (computer science); Markov process; Operations research; Artificial intelligence; Decision tree; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0001480861,0.000114243,0.000116573,0.00008376527,0.00007913756,0.0001978952,0.0007047174,0.00003318449,0.000002442266],"category_scores_gemma":[0.00004398992,0.00009181644,0.00002768265,0.0002986956,0.00003533011,0.0002562661,0.00007272774,0.0001097472,0.00004443236],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004143189,"about_ca_system_score_gemma":0.00002918772,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000005865992,"about_ca_topic_score_gemma":6.076265e-7,"domain_scores_codex":[0.9988911,0.00001510701,0.00014266,0.000222232,0.0002762798,0.0004526954],"domain_scores_gemma":[0.9992008,0.00003600592,0.0000751582,0.0005208779,0.00003662207,0.0001305554],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.00003173654,0.00012065,0.004821568,0.00002965357,0.00005650973,0.0001734149,0.001560647,0.1929507,0.00004786899,0.04473144,0.007147038,0.7483288],"study_design_scores_gemma":[0.000735433,0.0002819073,0.8630112,0.00001380507,0.00001497394,0.00006270746,0.00001221474,0.1220713,0.0003507805,0.000665763,0.01234196,0.0004379735],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005740398,0.00001129073,0.9367481,0.001611819,0.0002473521,0.0003952273,2.186429e-7,0.0002404078,0.05500512],"genre_scores_gemma":[0.9885843,0.000002848651,0.007149397,0.001373365,0.00009206023,0.00008355017,7.709997e-7,0.000006411393,0.002707256],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9828439,"threshold_uncertainty_score":0.3744166,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01430034957822372,"score_gpt":0.2105713125744464,"score_spread":0.1962709629962227,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}