{"id":"W3200155431","doi":"10.48550/arxiv.2109.05110","title":"An Empirical Comparison of Off-policy Prediction Learning Algorithms in the Four Rooms Environment","year":2021,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Algorithm; Artificial intelligence; Machine learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0005774845,0.0002612998,0.0003787786,0.0003189705,0.0001400102,0.0001438337,0.001953939,0.0002753405,0.00001752793],"category_scores_gemma":[0.00006643625,0.0002617774,0.0001574778,0.0006251022,0.0001176072,0.0003623021,0.001256415,0.001247498,0.00001347146],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003291686,"about_ca_system_score_gemma":0.0002135642,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001624591,"about_ca_topic_score_gemma":0.00001306289,"domain_scores_codex":[0.9975035,0.0006954974,0.0003832886,0.0008043913,0.0002845698,0.0003287225],"domain_scores_gemma":[0.9980316,0.0001645857,0.0004182185,0.001230043,0.00006032272,0.00009529271],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000006481029,0.0001325413,0.08089864,0.00002723566,0.0000320883,0.00006436291,0.002744713,0.9131388,0.00001515584,0.00106013,0.00001992244,0.001859953],"study_design_scores_gemma":[0.0002896794,0.0002044193,0.03585044,0.00005879485,0.00003154276,0.000003890819,0.0008950622,0.961792,0.00005341587,0.0002077257,0.0004082876,0.0002047223],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2454502,0.00003423461,0.7533872,0.0001104201,0.0001614576,0.0002057762,0.00000160009,0.00006695217,0.0005822254],"genre_scores_gemma":[0.9967994,0.0001782286,0.002580927,0.00005314309,0.00008576996,0.00000138488,0.00003894955,0.00001370433,0.0002484736],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.7513493,"threshold_uncertainty_score":0.9999834,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1066680578552088,"score_gpt":0.250100170987369,"score_spread":0.1434321131321602,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}