{"id":"W2568999269","doi":"10.1609/aaai.v30i1.10311","title":"Incremental Stochastic Factorization for Online Reinforcement Learning","year":2016,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Markov decision process; Reinforcement learning; Computer science; Non-negative matrix factorization; Probabilistic logic; Multiplicative function; Factorization; Divergence (linguistics); Bellman equation; Markov chain; Artificial intelligence; Markov process; Algorithm; Mathematical optimization; Theoretical computer science; Machine learning; Matrix decomposition; Mathematics; Eigenvalues and eigenvectors","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002166694,0.001359912,0.001702414,0.000644525,0.000421548,0.0008257763,0.001448082,0.001172001,0.006123506],"category_scores_gemma":[0.007480127,0.000581144,0.0008201411,0.0007177264,0.001104309,0.001296226,0.00112274,0.002267943,0.0008109956],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001545485,"about_ca_system_score_gemma":0.001776983,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006171475,"about_ca_topic_score_gemma":0.007010052,"domain_scores_codex":[0.9991328,0.0003301463,0.00004387265,0.0001860812,0.0002227469,0.00008444698],"domain_scores_gemma":[0.9975175,0.001804319,0.0001767325,0.0001580465,0.0002549092,0.00008851379],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00008846946,0.00008303981,0.000448644,0.0001661187,0.00006207875,0.0000816758,0.00006157673,0.849345,0.0008617929,0.08141572,0.002779748,0.06460611],"study_design_scores_gemma":[0.00001033529,0.00001748656,0.00002994668,0.000006324949,0.000004849803,0.000006872428,0.000002050273,0.9773119,0.0001109661,0.02189875,0.0005959977,0.000004491279],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0025192,0.0002969633,0.9951029,0.0001458634,0.00004801331,0.00004198716,0.00004156054,0.0002602517,0.001543293],"genre_scores_gemma":[0.6152559,0.0009133901,0.3754227,0.0003531865,0.0002197576,0.0006974491,0.000384397,0.0001626746,0.006590538],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006171475,"threshold_uncertainty_score":0.02048516,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0805954660865807,"score_gpt":0.3016254592844599,"score_spread":0.2210299931978792,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}