{"id":"W2161500856","doi":"10.1109/ichis.2005.75","title":"Monte Carlo off-policy reinforcement learning: a rough set approach","year":2005,"lang":"en","type":"article","venue":"","topic":"Rough Sets and Fuzzy Logic","field":"Computer Science","cited_by":14,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Winnipeg; University of Manitoba","funders":"Natural Sciences and Engineering Research Council of Canada; Manitoba Hydro","keywords":"Reinforcement learning; Monte Carlo method; Computer science; Context (archaeology); Swarm behaviour; Artificial intelligence; Mathematical optimization; Machine learning; Mathematics; Statistics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002249351,0.0001671796,0.0001669721,0.0001036413,0.0001557609,0.000202147,0.0007853709,0.0000662972,0.00003941441],"category_scores_gemma":[0.00002708245,0.0001268238,0.0000841479,0.0003950314,0.00002956544,0.0004950808,0.0003605585,0.0001851956,0.0002124901],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008692491,"about_ca_system_score_gemma":0.00007966949,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000321872,"about_ca_topic_score_gemma":0.0000097277,"domain_scores_codex":[0.998583,0.00004530196,0.0002440515,0.0003839704,0.0003179595,0.0004257697],"domain_scores_gemma":[0.9991877,0.000021719,0.00007102112,0.0005454026,0.00004288194,0.000131262],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000007185968,0.00009362857,0.0002307029,0.00001271031,0.00003235001,0.000007956443,0.003882004,0.6238625,0.00001339201,0.1539471,0.02087234,0.1970381],"study_design_scores_gemma":[0.0002532596,0.00008887777,0.0001836559,0.000002401008,0.000002274758,0.00001506236,0.00005545949,0.7545022,0.00003314535,0.000164182,0.2445313,0.0001681186],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.003961092,0.0002482267,0.3880218,0.005586592,0.0001054256,0.0002890373,5.941919e-7,0.0005349854,0.6012523],"genre_scores_gemma":[0.9043869,0.00006958099,0.07734326,0.002005753,0.0003072011,0.00002252971,0.000002625793,0.000009072369,0.01585311],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9004258,"threshold_uncertainty_score":0.5171726,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02617794070649943,"score_gpt":0.2556230226707021,"score_spread":0.2294450819642027,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}