{"id":"W2164941694","doi":"10.48550/arxiv.1206.6444","title":"Statistical Linear Estimation with Penalized Estimators: an Application to Reinforcement Learning","year":2012,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":17,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Estimator; Reinforcement learning; Regularization (linguistics); Applied mathematics; Mathematics; Mathematical optimization; Computer science; Feature (linguistics); Inverse problem; Function (biology); Algorithm; Artificial intelligence; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006596796,0.001254554,0.001544217,0.0007823574,0.0003859874,0.001417083,0.00160809,0.002218586,0.001380795],"category_scores_gemma":[0.02851341,0.0005990018,0.000815275,0.0008365602,0.003376499,0.001825488,0.002717216,0.002775746,0.0001926773],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001589662,"about_ca_system_score_gemma":0.001157347,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002182574,"about_ca_topic_score_gemma":0.001459677,"domain_scores_codex":[0.9966339,0.002239074,0.0001152042,0.0003398936,0.0005394049,0.0001324138],"domain_scores_gemma":[0.9769914,0.01951354,0.001239486,0.0007307301,0.00117911,0.0003458468],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00005742416,0.00005054647,0.0008231137,0.000129257,0.00007856487,0.0001140655,0.0001087667,0.861536,0.00112817,0.1165759,0.0006125714,0.01878564],"study_design_scores_gemma":[0.000006563948,0.00001867001,0.00003851237,0.000008897552,0.000004219026,0.000008976055,0.000003398577,0.9748024,0.000141598,0.02480975,0.0001518547,0.000005197182],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003676052,0.0002566986,0.9949508,0.0003009569,0.00002086262,0.00001631518,0.000007288935,0.0000502117,0.0007207969],"genre_scores_gemma":[0.6428519,0.000978329,0.3520219,0.0004150759,0.0002708797,0.0003420507,0.00006909657,0.0001385476,0.002912155],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006596796,"threshold_uncertainty_score":0.03488755,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0385205685199137,"score_gpt":0.2178593734831672,"score_spread":0.1793388049632535,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}