{"id":"W7039045101","doi":"","title":"Learning state representations in reinforcement learning using mixed policy successor features","year":2021,"lang":"en","type":"dissertation","venue":"eScholarship@McGill (McGill)","topic":"Historical and Architectural Studies","field":"Arts and Humanities","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Prior probability; Successor cardinal; Sample (material); Inefficiency; Initialization; Feature (linguistics); ENCODE","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.0003578177,0.0006621837,0.0007968344,0.0006943826,0.003875475,0.0003037043,0.0003492351,0.0002183678,0.0008107797],"category_scores_gemma":[0.001206405,0.0006404594,0.0003126185,0.0004279928,0.0001170954,0.0005157192,0.0001999113,0.002417763,0.00007235644],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000964947,"about_ca_system_score_gemma":0.00008408476,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.01242951,"about_ca_topic_score_gemma":0.04329646,"domain_scores_codex":[0.9961988,0.0005051449,0.0009155394,0.0008694674,0.0007054872,0.0008056168],"domain_scores_gemma":[0.9982872,0.0002773179,0.000575093,0.0002873791,0.000380544,0.0001924604],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0008902933,0.0005598544,0.0004042261,0.002268259,0.001569623,0.0007918729,0.01875857,0.09961201,0.02650473,0.3920667,0.00009462915,0.4564793],"study_design_scores_gemma":[0.00196762,0.0005088183,0.001992011,0.001937331,0.000348332,0.00002592804,0.02913465,0.0003555934,0.009921474,0.0159548,0.9347894,0.003064031],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7653524,0.0007452367,1.573648e-7,0.00006298981,0.001174714,0.0004046969,0.000105927,0.0002039903,0.2319499],"genre_scores_gemma":[0.8079919,0.0003702921,0.00008431018,0.00009859748,0.0002331286,0.00008465554,0.0009474827,0.0001131948,0.1900764],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9346948,"threshold_uncertainty_score":0.9998837,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02790454777727037,"score_gpt":0.2665603426383485,"score_spread":0.2386557948610782,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}