{"id":"W7071380059","doi":"","title":"Risk-directed exploration in reinforcement learning","year":2005,"lang":"en","type":"dissertation","venue":"eScholarship@McGill (McGill)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Reinforcement learning; Entropy (arrow of time); Measure (data warehouse); Action (physics); Reinforcement; Action selection; Class (philosophy)","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00168778,0.0005523792,0.0008563175,0.0003160624,0.000239545,0.001092523,0.0007708358,0.001112679,0.01869206],"category_scores_gemma":[0.006250837,0.0002918474,0.0002942566,0.0004980068,0.0009095997,0.001432679,0.001110323,0.001655217,0.002888423],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009980852,"about_ca_system_score_gemma":0.0009543015,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002699988,"about_ca_topic_score_gemma":0.00231865,"domain_scores_codex":[0.99943,0.000352959,0.0000233738,0.00007473029,0.00007418601,0.00004473688],"domain_scores_gemma":[0.997586,0.00198371,0.0001110033,0.0001111001,0.0001165727,0.00009172364],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005121973,0.0002454995,0.002231056,0.0003140078,0.0001426122,0.0001487406,0.0002031102,0.4599532,0.001253126,0.2020272,0.01661406,0.3163553],"study_design_scores_gemma":[0.0001118259,0.0001649782,0.0004158866,0.000066586,0.00001781187,0.00003949001,0.00003045992,0.8677739,0.0003558342,0.1223324,0.008675636,0.00001522612],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04508571,0.003472038,0.8690289,0.002645741,0.0002500728,0.0001435984,0.0001775785,0.001158226,0.07803821],"genre_scores_gemma":[0.8230914,0.002590293,0.113788,0.0004254924,0.0001721384,0.0004223217,0.0002409759,0.0002034607,0.05906602],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01869206,"threshold_uncertainty_score":0.06253123,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01879923180380377,"score_gpt":0.2485763170795089,"score_spread":0.2297770852757051,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}