{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":1145,"total_is_capped":false,"direct_labels_cover":2,"predictions_cover":1145,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"29852c204d50","filters":{"topic":"Reinforcement Learning in Robotics"}},"results":[{"id":"W2754517384","doi":"10.1609/aaai.v32i1.11694","title":"Deep Reinforcement Learning That Matters","year":2018,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1504,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"Open Philanthropy Project; Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Reinforcement learning; Computer science; Standardization; Benchmark (surveying); Artificial intelligence; Field (mathematics); Variance (accounting); Deep learning; Machine learning; Data science; Risk analysis (engineering); Mathematics","authors":[{"name":"Peter Henderson","is_ca":true},{"name":"Riashat Islam","is_ca":true},{"name":"Philip Bachman","is_ca":false},{"name":"Joëlle Pineau","is_ca":true},{"name":"Doina Precup","is_ca":true},{"name":"David Meger","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.07088540185984533,"gpt":0.288866159836522,"spread":0.2179807579766767,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01686241,0.0006897174,0.001237684,0.0004689479,0.0009112101,0.0047461,0.001606064,0.002484272,0.008552005],"category_scores_gemma":[0.09086421,0.0003431441,0.0003862609,0.0006189758,0.004028229,0.008155254,0.001766863,0.00595044,0.002446368],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002013156,"about_ca_system_score_gemma":0.002038659,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002344082,"about_ca_topic_score_gemma":0.001879315,"domain_scores_codex":[0.9907906,0.004212761,0.0004522181,0.002325859,0.00190102,0.0003175655],"domain_scores_gemma":[0.9601553,0.02693311,0.002241239,0.00459459,0.004792576,0.001283257],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006528513,0.0003101072,0.01374803,0.001308145,0.000562492,0.0001698814,0.000865069,0.02696334,0.003734228,0.4226038,0.103449,0.425633],"study_design_scores_gemma":[0.0001455595,0.0004001205,0.008300369,0.001195333,0.0001573027,0.0002673063,0.0007166684,0.06270193,0.00626424,0.7822539,0.1374741,0.0001232102],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09335494,0.05890464,0.3875997,0.3470389,0.01483829,0.0001843496,0.002536151,0.002732888,0.09281014],"genre_scores_gemma":[0.8573246,0.0157044,0.06008426,0.03940038,0.004706854,0.0002564235,0.001061658,0.001838903,0.01962258],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01686241,"threshold_uncertainty_score":0.08917803,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3100366369","doi":"10.1561/2200000071","title":"An Introduction to Deep Reinforcement Learning","year":2018,"lang":"en","type":"article","venue":"Foundations and Trends® in Machine Learning","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1251,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Artificial intelligence; Computer science; Deep learning; Generalization; Field (mathematics); Robotics; Machine learning; Robot; Mathematics","authors":[{"name":"Vincent François-Lavet","is_ca":true},{"name":"Peter Henderson","is_ca":true},{"name":"Riashat Islam","is_ca":true},{"name":"Marc G. Bellemare","is_ca":false},{"name":"Joëlle Pineau","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01379196626407731,"gpt":0.2905965508752665,"spread":0.2768045846111892,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008229304,0.0008366553,0.0006438546,0.000698091,0.0002486498,0.001329299,0.0009674388,0.001460329,0.01211225],"category_scores_gemma":[0.00271042,0.0005086096,0.0007122797,0.001124497,0.0009260098,0.001546997,0.0009403393,0.003745896,0.003766999],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001142233,"about_ca_system_score_gemma":0.0009410375,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001815033,"about_ca_topic_score_gemma":0.001585789,"domain_scores_codex":[0.9995043,0.0001101602,0.00004437744,0.0001105007,0.0001904145,0.00004022126],"domain_scores_gemma":[0.9989842,0.0007060483,0.00004541449,0.00006993479,0.0001450637,0.00004943957],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00004500047,0.00009777046,0.0007419307,0.0008211383,0.00008142079,0.0001834002,0.0001511165,0.06748132,0.001948348,0.5343176,0.05989978,0.3342313],"study_design_scores_gemma":[0.0000191349,0.00007830806,0.0004354625,0.0004574441,0.00002347522,0.0002727931,0.00002479342,0.1092211,0.000908612,0.5734285,0.3150787,0.00005175703],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"review","genre_scores_codex":[0.001046136,0.03745495,0.9141513,0.005073014,0.001577671,0.00006732728,0.0007104234,0.0007703488,0.03914879],"genre_scores_gemma":[0.1627237,0.113413,0.630762,0.005939945,0.006087467,0.0007773435,0.001976637,0.000732322,0.07758758],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.01211225,"threshold_uncertainty_score":0.04051954,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2150468603","doi":"10.1613/jair.3912","title":"The Arcade Learning Environment: An Evaluation Platform for General Agents","year":2013,"lang":"en","type":"article","venue":"Journal of Artificial Intelligence Research","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1060,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"Alberta Innovates; University of Alberta; Compute Canada","keywords":"Testbed; Benchmarking; Reinforcement learning; Benchmark (surveying); Imitation; Interface (matter)","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.2902597031161736,"gpt":0.4427010381262976,"spread":0.152441335010124,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01337618,0.001908025,0.001078831,0.002286951,0.0005852241,0.001953681,0.003830818,0.001737645,0.008489219],"category_scores_gemma":[0.03481341,0.0007657617,0.0009738894,0.001327463,0.001255557,0.002862258,0.003909424,0.003113078,0.002936229],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001480088,"about_ca_system_score_gemma":0.002318647,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004746819,"about_ca_topic_score_gemma":0.004241815,"domain_scores_codex":[0.9887922,0.007331612,0.0008097087,0.0008219923,0.001816693,0.00042776],"domain_scores_gemma":[0.9787911,0.01330225,0.0009883412,0.002991008,0.002880726,0.00104653],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003549396,0.003639912,0.0098472,0.003319166,0.000914829,0.000463411,0.001117868,0.4374845,0.007879542,0.05099973,0.1444713,0.3363132],"study_design_scores_gemma":[0.001494366,0.002020892,0.002326968,0.0002504004,0.0001246794,0.0001865743,0.0002384754,0.8897074,0.00915134,0.02375511,0.07060668,0.0001371563],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.07411522,0.00135767,0.7953433,0.001674257,0.0007121144,0.004908601,0.008251042,0.08102206,0.03261568],"genre_scores_gemma":[0.2756532,0.000527038,0.6941121,0.0006190911,0.00009082857,0.007379126,0.009865311,0.006918795,0.004834517],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01337618,"threshold_uncertainty_score":0.07074082,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2964227312","doi":"10.1609/aaai.v31i1.10916","title":"The Option-Critic Architecture","year":2017,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":695,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"Fonds de recherche du Québec – Nature et technologies; Natural Sciences and Engineering Research Council of Canada","keywords":"Reinforcement learning; Flexibility (engineering); Computer science; Abstraction; Architecture; Key (lock); Artificial intelligence; Machine learning; Computer security; Economics; Management; Epistemology","authors":[{"name":"Pierre‐Luc Bacon","is_ca":true},{"name":"Jean Harb","is_ca":true},{"name":"Doina Precup","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01411873004184306,"gpt":0.2683013584491692,"spread":0.2541826284073262,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009561714,0.0008001137,0.0006322312,0.0003441047,0.0004525835,0.001186317,0.001519565,0.001340026,0.004058838],"category_scores_gemma":[0.003774069,0.000599154,0.0005988979,0.0003453439,0.001724017,0.002400473,0.001797566,0.003212797,0.0008594168],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008784215,"about_ca_system_score_gemma":0.001368139,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002566592,"about_ca_topic_score_gemma":0.003196265,"domain_scores_codex":[0.9994716,0.0001520029,0.00002953173,0.000135506,0.0001607638,0.00005060763],"domain_scores_gemma":[0.9991235,0.0004165965,0.00007339577,0.0001515151,0.000141286,0.00009372817],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00008669641,0.00003656457,0.000623595,0.0001043588,0.00007058808,0.0001705869,0.0001150471,0.5908361,0.003428852,0.346081,0.002975099,0.05547143],"study_design_scores_gemma":[0.00001798063,0.00002321983,0.00009602516,0.00001636447,0.00001488949,0.00004263932,0.000005768986,0.8634123,0.0005979657,0.1329641,0.002794942,0.00001380048],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.008548323,0.0003637341,0.9795291,0.0008304197,0.0000826785,0.00004068292,0.00007408186,0.0005093313,0.01002167],"genre_scores_gemma":[0.6983116,0.0007582029,0.2875843,0.0004188191,0.000126762,0.0002796353,0.0001630089,0.000146916,0.01221076],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004058838,"threshold_uncertainty_score":0.01357818,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2094387729","doi":"10.1016/j.automatica.2009.07.008","title":"Natural actor–critic algorithms","year":2009,"lang":"en","type":"article","venue":"Automatica","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":569,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Temporal difference learning; Reinforcement learning; Computer science; Function approximation; Convergence (economics); Bellman equation; Mathematical proof; Function (biology); Stochastic gradient descent; Variance (accounting); Mathematics; Mathematical optimization; Artificial intelligence; Applied mathematics; Algorithm; Artificial neural network","authors":[{"name":"Shalabh Bhatnagar","is_ca":false},{"name":"Richard Sutton","is_ca":true},{"name":"Mohammad Ghavamzadeh","is_ca":false},{"name":"Mark Lee","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.009214446772915929,"gpt":0.2557505181836024,"spread":0.2465360714106865,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00133634,0.0008623444,0.000780511,0.0004885596,0.0005726913,0.000897716,0.001278947,0.001616539,0.0069444],"category_scores_gemma":[0.003892239,0.0005689578,0.0005047329,0.0003782699,0.001213521,0.001250851,0.001012431,0.001551954,0.001602722],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005894248,"about_ca_system_score_gemma":0.0008228104,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0012352,"about_ca_topic_score_gemma":0.002175177,"domain_scores_codex":[0.9994937,0.0001884871,0.00002587997,0.0001567341,0.0001010924,0.00003417404],"domain_scores_gemma":[0.9987341,0.000776974,0.00007584225,0.0001853443,0.000182759,0.00004504412],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001102242,0.0001096189,0.0005981494,0.0002055258,0.00009454824,0.00009158626,0.00009331269,0.6211019,0.003402977,0.165495,0.009209668,0.1994876],"study_design_scores_gemma":[0.00001467423,0.00001632886,0.00005114386,0.000008618609,0.000008045756,0.00002494151,0.000004969598,0.9583105,0.0004703049,0.03864738,0.00243715,0.000005869494],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.004533079,0.0004114238,0.9861299,0.0002477291,0.0001222294,0.00003444306,0.00002717905,0.0005410488,0.007952861],"genre_scores_gemma":[0.4347113,0.0006529115,0.5399045,0.000430031,0.0001886026,0.0003064238,0.0001864661,0.0002860199,0.02333382],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0069444,"threshold_uncertainty_score":0.02323127,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2626637010","doi":"10.4230/lipics.cp.2023.25","title":"Learning a Generic Value-Selection Heuristic Inside a Constraint Programming Solver","year":2017,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":523,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Polytechnique Montréal","funders":"","keywords":"Decomposition; Value (mathematics); Computer science; Artificial intelligence; Machine learning; Chemistry","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.07875522306874225,"gpt":0.2092543842109096,"spread":0.1304991611421674,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002489097,0.001231581,0.001238604,0.0006683621,0.0004200772,0.001479503,0.001951388,0.002238475,0.005142099],"category_scores_gemma":[0.00906559,0.0006081467,0.00089055,0.0009063312,0.001531945,0.001658173,0.00188331,0.002551159,0.0008429335],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001208169,"about_ca_system_score_gemma":0.002315177,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001877745,"about_ca_topic_score_gemma":0.002511876,"domain_scores_codex":[0.9986004,0.0005695784,0.00007332216,0.000329362,0.0002360361,0.0001912747],"domain_scores_gemma":[0.9962202,0.002722851,0.000304952,0.0002913158,0.0002967469,0.0001639758],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001120283,0.0001332521,0.0008551473,0.0001855505,0.00005122298,0.0001335652,0.00009790236,0.8495513,0.002104193,0.06050227,0.003111804,0.08316179],"study_design_scores_gemma":[0.00002015188,0.00002264751,0.00004378961,0.00001417409,0.000006330248,0.0000149179,0.000008780971,0.9827047,0.0006053961,0.01596327,0.0005905093,0.000005412751],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.009355835,0.00009579103,0.9866548,0.0002610932,0.00003079299,0.00008565192,0.00004767465,0.0004108635,0.003057518],"genre_scores_gemma":[0.3869174,0.0001884365,0.6085796,0.000396389,0.00006947942,0.000410825,0.0002127166,0.0002386689,0.002986515],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005142099,"threshold_uncertainty_score":0.01720202,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2144913588","doi":"10.1613/jair.2567","title":"Online Planning Algorithms for POMDPs","year":2008,"lang":"en","type":"article","venue":"Journal of Artificial Intelligence Research","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":515,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Université Laval; McGill University","funders":"National Institute of Mental Health; Fonds Québécois de la Recherche sur la Nature et les Technologies","keywords":"Partially observable Markov decision process; Computer science; Heuristic; Markov decision process; Mathematical optimization; Upper and lower bounds; Reduction (mathematics); Observable; Focus (optics); Computational complexity theory; Action (physics); Artificial intelligence; Machine learning; Markov process; Markov chain; Algorithm; Markov model; Mathematics","authors":[{"name":"Stéphane Ross","is_ca":true},{"name":"Joëlle Pineau","is_ca":true},{"name":"S. Paquet","is_ca":true},{"name":"Brahim Chaib-draa","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4539481331437369,"gpt":0.4870388551056944,"spread":0.0330907219619575,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001822599,0.001692746,0.001766019,0.0008094936,0.0009390407,0.001468614,0.001948461,0.001534261,0.007722979],"category_scores_gemma":[0.00600829,0.0008495533,0.001174635,0.0009942529,0.00140311,0.002278903,0.00210889,0.002522729,0.0008390297],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001661369,"about_ca_system_score_gemma":0.002689934,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006411201,"about_ca_topic_score_gemma":0.007155139,"domain_scores_codex":[0.9988386,0.0004038612,0.00008412098,0.0002477339,0.0002826798,0.0001430957],"domain_scores_gemma":[0.9959903,0.003198366,0.0002709852,0.0002339043,0.0001839165,0.0001224953],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007728505,0.00007793029,0.0002494052,0.0001798804,0.000042349,0.00005522608,0.00006714846,0.9046542,0.0003635836,0.04603207,0.001524885,0.04667607],"study_design_scores_gemma":[0.00003477538,0.00002201183,0.0000274054,0.00001714049,0.000009255294,0.00001306346,0.00001434918,0.9623732,0.0002269494,0.0362148,0.001041439,0.000005562395],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.004665816,0.0005017859,0.9902807,0.0001623839,0.00004451199,0.00008982225,0.0000942896,0.0007344637,0.003426085],"genre_scores_gemma":[0.381019,0.001102506,0.6122476,0.0002131879,0.00009034325,0.0007896485,0.0005325382,0.000298679,0.003706469],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007722979,"threshold_uncertainty_score":0.02583593,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4224220194","doi":"10.1016/j.neunet.2022.03.037","title":"Deep learning, reinforcement learning, and world models","year":2022,"lang":"en","type":"review","venue":"Neural Networks","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":493,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Artificial intelligence; Computer science; Session (web analytics); Human intelligence; Deep learning; Cognitive science; Reinforcement; Psychology","authors":[{"name":"Yutaka Matsuo","is_ca":false},{"name":"Yann LeCun","is_ca":false},{"name":"Maneesh Sahani","is_ca":false},{"name":"Doina Precup","is_ca":true},{"name":"David Silver","is_ca":false},{"name":"Masashi Sugiyama","is_ca":false},{"name":"Eiji Uchibe","is_ca":false},{"name":"Jun Morimoto","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04696882901226523,"gpt":0.2927112085831605,"spread":0.2457423795708953,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000564371,0.0008358652,0.0008830496,0.001251639,0.0002000842,0.0009371378,0.0007494772,0.001239888,0.002299385],"category_scores_gemma":[0.001046926,0.0002989797,0.0004019927,0.001709689,0.000669213,0.001669053,0.0005843914,0.00177481,0.0008937926],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007439223,"about_ca_system_score_gemma":0.001206911,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001635076,"about_ca_topic_score_gemma":0.001696876,"domain_scores_codex":[0.9998467,0.0000387959,0.00001455686,0.00003085355,0.0000552343,0.00001392824],"domain_scores_gemma":[0.9996673,0.0002139531,0.00003123653,0.00001119776,0.00005681988,0.00001951411],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00004622967,0.00007555014,0.0002889558,0.01118022,0.0001109204,0.0001194841,0.00006306879,0.005105667,0.0006332055,0.04952654,0.02633995,0.9065102],"study_design_scores_gemma":[0.00002181617,0.0001145086,0.0009933925,0.00525447,0.000133071,0.0007494107,0.00006992096,0.003872494,0.0008567607,0.06209995,0.9257832,0.00005104932],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.000266991,0.9915149,0.003327353,0.001069738,0.0002749429,0.000008070853,0.00002741005,0.00002227826,0.003488287],"genre_scores_gemma":[0.00487364,0.9923897,0.001078806,0.0003699147,0.0002951008,0.00001690327,0.0000457823,0.000003960376,0.000926211],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.002299385,"threshold_uncertainty_score":0.007692277,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2055921164","doi":"10.1007/s10458-012-9200-2","title":"A survey of point-based POMDP solvers","year":2012,"lang":"en","type":"article","venue":"Autonomous Agents and Multi-Agent Systems","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":433,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Partially observable Markov decision process; Markov decision process; Computer science; Bellman equation; Function (biology); Observable; Value (mathematics); Point (geometry); State space; Mathematical optimization; Theoretical computer science; Space (punctuation); Scale (ratio); Markov chain; Markov process; Mathematics; Markov model; Machine learning","authors":[{"name":"Guy Shani","is_ca":false},{"name":"Joëlle Pineau","is_ca":true},{"name":"Robert Kaplow","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06430470677447479,"gpt":0.2858437758454526,"spread":0.2215390690709778,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001568582,0.001619746,0.002730085,0.001237132,0.0006101618,0.002119256,0.004009139,0.001857504,0.006367066],"category_scores_gemma":[0.004042978,0.001155516,0.001540329,0.003400004,0.0008185172,0.002058957,0.002403722,0.002229208,0.002408357],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008268436,"about_ca_system_score_gemma":0.001699971,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004555707,"about_ca_topic_score_gemma":0.004043397,"domain_scores_codex":[0.9989374,0.000295753,0.0001122125,0.0001586496,0.0004289758,0.00006707801],"domain_scores_gemma":[0.9987143,0.0008001769,0.00006625631,0.0001450627,0.0002324459,0.00004175323],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001045762,0.0001178883,0.0005464181,0.001238308,0.0001662243,0.00005098856,0.00007166599,0.5266234,0.0006656771,0.05297909,0.0076984,0.4097374],"study_design_scores_gemma":[0.00005548712,0.00004841902,0.0001263976,0.0001483024,0.00004135914,0.00004812752,0.00002419692,0.950703,0.0005168721,0.03698795,0.01128303,0.00001681653],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"review","genre_scores_codex":[0.001954019,0.008520793,0.9814387,0.0002669755,0.0001007522,0.00008090495,0.0001323593,0.0006877345,0.006817837],"genre_scores_gemma":[0.1188852,0.02461714,0.848263,0.0004178148,0.0003437936,0.000567009,0.0008846631,0.0004717561,0.005549634],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.006367066,"threshold_uncertainty_score":0.02129996,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2963923407","doi":"","title":"Addressing Function Approximation Error in Actor-Critic Methods","year":2018,"lang":"en","type":"article","venue":"UvA-DARE (University of Amsterdam)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":414,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Computer science; Bellman equation; Suite; Function (biology); Function approximation; Value (mathematics); Limit (mathematics); Artificial intelligence; Approximation algorithm; Temporal difference learning; Mathematical optimization; Machine learning; Algorithm; Artificial neural network; Mathematics","authors":[{"name":"Scott Fujimoto","is_ca":true},{"name":"Herke van Hoof","is_ca":false},{"name":"David Meger","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.07700182874909071,"gpt":0.3215285431639732,"spread":0.2445267144148824,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006675546,0.002048607,0.002305738,0.0006133356,0.0006164487,0.001655963,0.002410543,0.002584413,0.002206057],"category_scores_gemma":[0.02189939,0.0009211313,0.0004926783,0.0005594149,0.002085866,0.002039509,0.002371957,0.003756252,0.0006170324],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001360861,"about_ca_system_score_gemma":0.001935544,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003352937,"about_ca_topic_score_gemma":0.002667639,"domain_scores_codex":[0.9979382,0.0009318911,0.0001155553,0.0003452617,0.0004675464,0.0002015298],"domain_scores_gemma":[0.9891884,0.007904612,0.0006460999,0.0006588059,0.001316234,0.0002859781],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001642384,0.00005795956,0.0009682485,0.0001208867,0.00007296595,0.00008064903,0.00009485982,0.9358764,0.00125958,0.01582992,0.001339221,0.04413511],"study_design_scores_gemma":[0.00001365047,0.00002325637,0.00003899366,0.00001186063,0.000006012386,0.00001257516,0.00000511307,0.9926397,0.0004879768,0.00650691,0.0002494765,0.000004561523],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.009835275,0.0004761258,0.9874355,0.000329293,0.00007493994,0.00003285941,0.00001604113,0.0004327084,0.001367391],"genre_scores_gemma":[0.8020002,0.0003641539,0.1925849,0.0004275609,0.0001101016,0.0002075921,0.00007741661,0.0002744173,0.003953543],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006675546,"threshold_uncertainty_score":0.03530407,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2104641222","doi":"10.1177/105971230501300301","title":"Reinforcement Learning for RoboCup Soccer Keepaway","year":2005,"lang":"en","type":"article","venue":"Adaptive Behavior","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":390,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Generality; Computer science; Artificial intelligence; Learning classifier system; Benchmark (surveying); Machine learning; Task (project management); Psychology","authors":[{"name":"Peter Stone","is_ca":false},{"name":"Richard S. Sutton","is_ca":true},{"name":"Gregory Kuhlmann","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03632614507992138,"gpt":0.2862749197792012,"spread":0.2499487746992798,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008475916,0.0004718101,0.0005733386,0.0002201882,0.0002738269,0.0003469592,0.0006829743,0.0005091711,0.001400821],"category_scores_gemma":[0.00331966,0.000223417,0.0002025863,0.0001356706,0.0006816884,0.0004538231,0.0005990446,0.0009281602,0.0001367354],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008225125,"about_ca_system_score_gemma":0.0009632353,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007358919,"about_ca_topic_score_gemma":0.005080897,"domain_scores_codex":[0.9997601,0.0001034686,0.00001219518,0.00004266215,0.00004648774,0.00003515376],"domain_scores_gemma":[0.9987208,0.0008347277,0.000125563,0.00007727383,0.0001492175,0.00009237114],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006294464,0.00005121001,0.0006716202,0.00002256166,0.0000141538,0.00002764312,0.00003074422,0.9783586,0.0006270203,0.002156517,0.0002896216,0.01768735],"study_design_scores_gemma":[0.000009836617,0.00001732808,0.00005524126,0.000001636638,0.000001704203,0.000002568623,0.000003275749,0.9983328,0.0002306994,0.0012571,0.00008631531,0.000001542243],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2652726,0.0003449272,0.7282676,0.0006733661,0.00005695808,0.0001085862,0.00006104542,0.001229463,0.003985442],"genre_scores_gemma":[0.9799926,0.00004489951,0.0190737,0.00004712596,0.000007936806,0.00005925435,0.00003265957,0.0000159354,0.0007259023],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007358919,"threshold_uncertainty_score":0.01463217,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2132622533","doi":"10.5555/2031678.2031726","title":"Horde: a scalable real-time architecture for learning knowledge from unsupervised sensorimotor interaction","year":2011,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":305,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University; University of Alberta","funders":"","keywords":"Computer science; Artificial intelligence; Reinforcement learning; Function (biology); Scalability; Temporal difference learning; Modular design; Architecture; Robot; Robot learning; Robotics; Machine learning; Unsupervised learning; Mobile robot","authors":[{"name":"Richard S. Sutton","is_ca":true},{"name":"Joseph Modayil","is_ca":true},{"name":"Michael Delp","is_ca":true},{"name":"Thomas Degris","is_ca":true},{"name":"Patrick M. Pilarski","is_ca":true},{"name":"Adam White","is_ca":true},{"name":"Doina Precup","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03268646550292204,"gpt":0.2583288463899193,"spread":0.2256423808869972,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008872101,0.0006710648,0.0007572792,0.0002982611,0.0003660377,0.0006949828,0.003404717,0.000827138,0.003534104],"category_scores_gemma":[0.00170126,0.0005913058,0.0005085054,0.0002676611,0.0009096265,0.001797557,0.002041813,0.001985354,0.0009462184],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007552839,"about_ca_system_score_gemma":0.001291645,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004233822,"about_ca_topic_score_gemma":0.007976656,"domain_scores_codex":[0.9996651,0.00004551597,0.00001982697,0.0001116454,0.0001129311,0.00004490156],"domain_scores_gemma":[0.999398,0.0002003988,0.00005147826,0.0001724533,0.0001188392,0.00005885834],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003914035,0.0003480581,0.001433282,0.0002021473,0.000156697,0.0001804572,0.0001706655,0.5644562,0.02153385,0.01554045,0.006380974,0.3892058],"study_design_scores_gemma":[0.00002782707,0.00004680526,0.0001253488,0.000004781335,0.00001127384,0.00002451306,0.000009326564,0.9881544,0.004151318,0.005598011,0.001837469,0.000008858327],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01287775,0.0001500123,0.9808531,0.0001313348,0.00003947391,0.00008207942,0.00006286649,0.004196887,0.001606432],"genre_scores_gemma":[0.4292704,0.0002777332,0.5621316,0.0002621163,0.00003374795,0.0004109335,0.0004702672,0.000290218,0.006852991],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004233822,"threshold_uncertainty_score":0.01182276,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4353091694","doi":"10.1038/s41467-023-37180-x","title":"Catalyzing next-generation Artificial Intelligence through NeuroAI","year":2023,"lang":"en","type":"review","venue":"Nature Communications","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":283,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University; Mila - Quebec Artificial Intelligence Institute; Ontario Brain Institute; Montreal Neurological Institute and Hospital","funders":"National Institute of Neurological Disorders and Stroke; National Institute of General Medical Sciences; National Eye Institute; National Institute of Mental Health; Natural Sciences and Engineering Research Council of Canada; Intelligence Advanced Research Projects Activity; Defense Advanced Research Projects Agency; Office of Naval Research; Cold Spring Harbor Laboratory; Multidisciplinary University Research Initiative; James S. McDonnell Foundation; Canadian Institute for Advanced Research; National Science Foundation; Semiconductor Research Corporation; National Institutes of Health; Lourie Foundation; Howard Hughes Medical Institute","keywords":"Computer science; Artificial intelligence; Data science","authors":[{"name":"Anthony M. Zador","is_ca":false},{"name":"G. Sean Escola","is_ca":false},{"name":"Blake A. Richards","is_ca":true},{"name":"Bence P. Ölveczky","is_ca":false},{"name":"Yoshua Bengio","is_ca":true},{"name":"Kwabena Boahen","is_ca":false},{"name":"Matthew Botvinick","is_ca":false},{"name":"Dmitri B. Chklovskii","is_ca":false},{"name":"Anne K. Churchland","is_ca":false},{"name":"Claudia Clopath","is_ca":false},{"name":"James J. DiCarlo","is_ca":false},{"name":"Surya Ganguli","is_ca":false},{"name":"Jeff Hawkins","is_ca":false},{"name":"Konrad P. Körding","is_ca":false},{"name":"Alexei A. Koulakov","is_ca":false},{"name":"Yann LeCun","is_ca":false},{"name":"Timothy Lillicrap","is_ca":false},{"name":"Adam Marblestone","is_ca":false},{"name":"Bruno A. Olshausen","is_ca":false},{"name":"Alexandre Pouget","is_ca":false},{"name":"Cristina Savin","is_ca":false},{"name":"Terrence J. Sejnowski","is_ca":false},{"name":"Eero P. Simoncelli","is_ca":false},{"name":"Sara A. Solla","is_ca":false},{"name":"David Sussillo","is_ca":false},{"name":"Andreas S. Tolias","is_ca":false},{"name":"Doris Y. Tsao","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3747334748993592,"gpt":0.4284879568866756,"spread":0.05375448198731642,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006930418,0.000734062,0.0006269018,0.001257634,0.000316023,0.001393294,0.001072227,0.001498413,0.005223297],"category_scores_gemma":[0.001063838,0.0002627664,0.0004309948,0.001353084,0.0009479374,0.002788434,0.001143421,0.002682745,0.003612658],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000856575,"about_ca_system_score_gemma":0.001020122,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008005393,"about_ca_topic_score_gemma":0.001305722,"domain_scores_codex":[0.999777,0.00004886367,0.00001563775,0.00003552277,0.00009696603,0.00002602099],"domain_scores_gemma":[0.9996234,0.0002269635,0.00003227388,0.00002226788,0.00006275129,0.00003229309],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00004503164,0.00006884576,0.0001540263,0.008527664,0.00008248502,0.0001618843,0.0001169647,0.00171156,0.001760368,0.1022786,0.04317736,0.8419152],"study_design_scores_gemma":[0.00000731559,0.00002946114,0.0001409241,0.001224535,0.00002401191,0.0002513051,0.00003154576,0.0002637689,0.0004269246,0.02009925,0.9774889,0.00001203702],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0002474122,0.9869784,0.001881419,0.001302565,0.0004892366,0.000008023307,0.00002432773,0.00003586673,0.009032658],"genre_scores_gemma":[0.003970777,0.9912853,0.001106015,0.0007732622,0.0003747559,0.0000216406,0.0000517338,0.00001093849,0.002405642],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.005223297,"threshold_uncertainty_score":0.0174737,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2904453761","doi":"10.48550/arxiv.1812.02900","title":"Off-Policy Deep Reinforcement Learning without Exploration","year":2018,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":280,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Computer science; Extrapolation; Artificial intelligence; Reinforcement; Class (philosophy); Uncorrelated; Space (punctuation); Action (physics); Control (management); Machine learning; Mathematics; Engineering","authors":[{"name":"Scott Fujimoto","is_ca":true},{"name":"David Meger","is_ca":false},{"name":"Doina Precup","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0781399192839883,"gpt":0.2175502889724059,"spread":0.1394103696884176,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00175459,0.0008779161,0.0009195449,0.0002358588,0.0002485543,0.000637893,0.001275634,0.0009281942,0.001795976],"category_scores_gemma":[0.006565266,0.0003839192,0.0002757785,0.0002647619,0.001603134,0.001156481,0.001097471,0.001711086,0.0003052453],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009173156,"about_ca_system_score_gemma":0.001365539,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004081399,"about_ca_topic_score_gemma":0.00296958,"domain_scores_codex":[0.9994866,0.0001809631,0.00002546252,0.0001173282,0.0001037463,0.0000858753],"domain_scores_gemma":[0.9972153,0.001867331,0.0002265053,0.0003140177,0.0002433279,0.000133557],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001961833,0.0001025265,0.0009824656,0.00007172533,0.00002939377,0.00005945359,0.00005794657,0.92636,0.001664713,0.01860477,0.001220653,0.05065031],"study_design_scores_gemma":[0.00001389427,0.00003694152,0.00005309807,0.00000492369,0.000002481471,0.000007197447,0.000003602458,0.9935582,0.0004494046,0.005643531,0.0002238565,0.000002925314],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.06402618,0.0002984046,0.9297512,0.0004241476,0.00007065608,0.00008364939,0.00005854042,0.000870413,0.004416904],"genre_scores_gemma":[0.9364135,0.0001042177,0.06045766,0.0002028105,0.0000226822,0.0001246775,0.00007287462,0.00005439977,0.002547248],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004081399,"threshold_uncertainty_score":0.009279311,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3107153805","doi":"10.1038/s41586-020-2939-8","title":"Autonomous navigation of stratospheric balloons using reinforcement learning","year":2020,"lang":"en","type":"article","venue":"Nature","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":272,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Google (Canada)","funders":"","keywords":"Reinforcement learning; Computer science; Controller (irrigation); Obstacle avoidance; Process (computing); Obstacle; Reinforcement; Real-time computing; Artificial intelligence; Simulation; Engineering","authors":[{"name":"Marc G. Bellemare","is_ca":true},{"name":"Salvatore Candido","is_ca":false},{"name":"Pablo Samuel Castro","is_ca":true},{"name":"Jun Gong","is_ca":false},{"name":"Marlos C. Machado","is_ca":true},{"name":"Subhodeep Moitra","is_ca":true},{"name":"Sameera Ponda","is_ca":false},{"name":"Ziyu Wang","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01814971253088397,"gpt":0.2613037861494292,"spread":0.2431540736185452,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004528383,0.0003290128,0.0004206077,0.0002129007,0.0002864903,0.0004278577,0.0005455865,0.0005574573,0.0007548871],"category_scores_gemma":[0.001864032,0.000207469,0.0002405316,0.0001554057,0.0007902462,0.0004683564,0.0006220657,0.0006957601,0.0001243544],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004604977,"about_ca_system_score_gemma":0.0006066091,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005956338,"about_ca_topic_score_gemma":0.004279956,"domain_scores_codex":[0.9998683,0.00004910498,0.000005249321,0.00002498924,0.0000298148,0.00002260175],"domain_scores_gemma":[0.9994272,0.0003073553,0.00008560234,0.00004329403,0.00008747062,0.00004914032],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006672545,0.00003282067,0.001003031,0.00001913475,0.00002227694,0.00003159546,0.00003363698,0.9693455,0.002501015,0.004500513,0.0003795556,0.02206422],"study_design_scores_gemma":[0.000007026286,0.0000204762,0.00009229728,0.000001713279,0.00000245206,0.000004731431,0.000003212937,0.9975436,0.0002801113,0.001898454,0.0001437468,0.000002136719],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1809496,0.0004026699,0.8118282,0.0004650708,0.0001176719,0.00004497914,0.00003114144,0.000548619,0.005611976],"genre_scores_gemma":[0.9769408,0.00006760935,0.02189173,0.0000370136,0.00001327749,0.0000229893,0.00001683959,0.00001454768,0.0009952608],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005956338,"threshold_uncertainty_score":0.01184338,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1556824961","doi":"10.1007/3-540-45622-8_16","title":"Learning Options in Reinforcement Learning","year":2002,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":270,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Computer science; Psychology; Artificial intelligence","authors":[{"name":"Martin Stolle","is_ca":true},{"name":"Doina Precup","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02108976112327637,"gpt":0.2445734416842048,"spread":0.2234836805609284,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008140765,0.0006318201,0.0006800895,0.000288508,0.0002610897,0.001121903,0.0007976601,0.0008988484,0.007125658],"category_scores_gemma":[0.002913787,0.0003402363,0.000391677,0.0004951528,0.001527469,0.002565952,0.0008071463,0.002286638,0.0008303144],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006548396,"about_ca_system_score_gemma":0.0003064063,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005394966,"about_ca_topic_score_gemma":0.000620177,"domain_scores_codex":[0.9996715,0.0001679115,0.00001474787,0.00004713654,0.00007814249,0.00002058658],"domain_scores_gemma":[0.9990978,0.000738562,0.00002939278,0.00005775956,0.00004685892,0.00002963823],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00004223638,0.00004484657,0.0002077991,0.0001324464,0.0000262381,0.0000570968,0.0001197947,0.07452527,0.0004648939,0.7852796,0.004638289,0.1344615],"study_design_scores_gemma":[0.00001462453,0.00002195527,0.00006504189,0.00003106277,0.000007649739,0.00002769291,0.00001740859,0.1537765,0.0003155732,0.8397244,0.005989775,0.000008328362],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01452439,0.006235654,0.9178274,0.001506719,0.0003095269,0.00003816838,0.00006440291,0.0002838838,0.05920988],"genre_scores_gemma":[0.6823305,0.006068602,0.251051,0.0004175187,0.0004628431,0.0002897172,0.0001939879,0.0001673007,0.05901855],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007125658,"threshold_uncertainty_score":0.02383769,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1600046456","doi":"","title":"Off-Policy Temporal Difference Learning with Function Approximation","year":2001,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":254,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Temporal difference learning; Computer science; Function approximation; Function (biology); Artificial intelligence; Reinforcement learning; Artificial neural network","authors":[{"name":"Doina Precup","is_ca":true},{"name":"Richard S. Sutton","is_ca":false},{"name":"Sanjoy Dasgupta","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01561973101356947,"gpt":0.2314765468665761,"spread":0.2158568158530067,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032947,0.001141442,0.001641894,0.0007350025,0.0005181968,0.001425255,0.003069015,0.002271652,0.007307505],"category_scores_gemma":[0.01263729,0.0006367684,0.0008568828,0.0008196895,0.001867261,0.002441896,0.002988291,0.003769537,0.001498401],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001956615,"about_ca_system_score_gemma":0.002237915,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003636187,"about_ca_topic_score_gemma":0.002314019,"domain_scores_codex":[0.9986171,0.0003709684,0.00007567472,0.0002993096,0.0004491298,0.0001878533],"domain_scores_gemma":[0.9960349,0.002621733,0.0002524039,0.000370947,0.000520805,0.0001991537],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003134864,0.000236206,0.001060862,0.0001587575,0.00005696307,0.0001128839,0.0001649289,0.6316692,0.002081516,0.1123398,0.004305748,0.2474997],"study_design_scores_gemma":[0.00001524244,0.00003364303,0.00002897855,0.000009603483,0.000002896188,0.00001835902,0.000003964853,0.9859473,0.000417484,0.01281674,0.0007013529,0.000004523283],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003496256,0.0001500753,0.9932249,0.0001840198,0.00006489106,0.00006729941,0.00002771369,0.0004195545,0.002365196],"genre_scores_gemma":[0.4262032,0.0002563175,0.5633009,0.0007245957,0.0001176122,0.000512255,0.0002784972,0.0003407318,0.008266045],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007307505,"threshold_uncertainty_score":0.02444601,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1496855202","doi":"10.48550/arxiv.1301.6690","title":"Model-Based Bayesian Exploration","year":2013,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":235,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Reinforcement learning; Value of information; Action (physics); Bayesian probability; Quality (philosophy); Artificial intelligence; Value (mathematics); Machine learning; Probability distribution; Mathematical optimization; Mathematics; Statistics","authors":[{"name":"Richard Dearden","is_ca":true},{"name":"Nir Friedman","is_ca":false},{"name":"David André","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.07631130262408777,"gpt":0.1767027802933835,"spread":0.1003914776692957,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002133285,0.0009622574,0.001577065,0.001022639,0.0005901604,0.001980171,0.001754894,0.001385522,0.004955596],"category_scores_gemma":[0.009571326,0.000744114,0.0008366693,0.000993052,0.001546713,0.003038081,0.00191524,0.002010569,0.0007883726],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001887278,"about_ca_system_score_gemma":0.001774324,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00415092,"about_ca_topic_score_gemma":0.005593801,"domain_scores_codex":[0.9987634,0.0005842911,0.00004997272,0.0002199469,0.0002925618,0.00008981128],"domain_scores_gemma":[0.9970394,0.002021674,0.0002726184,0.0002514258,0.000298393,0.0001164205],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007831826,0.00004702756,0.0008798898,0.0001220454,0.00006733849,0.00006175652,0.0001008111,0.7935006,0.0004632267,0.160047,0.001812631,0.0428193],"study_design_scores_gemma":[0.00001874118,0.00001885458,0.0001182562,0.00002500906,0.00001133218,0.00002312073,0.00001172844,0.8400288,0.0001955015,0.1579914,0.001546332,0.00001107573],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01034926,0.0006014179,0.9806249,0.0007207014,0.00003170467,0.00003963692,0.0001076728,0.0002636145,0.007261127],"genre_scores_gemma":[0.777607,0.001333282,0.2122416,0.0003662325,0.0001177299,0.000316571,0.0003546103,0.0001441359,0.007518826],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004955596,"threshold_uncertainty_score":0.01657808,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2236244207","doi":"10.1561/2200000049","title":"Bayesian Reinforcement Learning: A Survey","year":2015,"lang":"en","type":"article","venue":"Foundations and Trends® in Machine Learning","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":223,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Computer science; Machine learning; Reinforcement learning; Artificial intelligence; Bayesian inference; Bayesian probability; Variable-order Bayesian network; Prior probability; Inference; Bellman equation; Algorithm; Mathematical optimization; Mathematics","authors":[{"name":"Mohammed Ghavamzadeh","is_ca":false},{"name":"Shie Mannor","is_ca":false},{"name":"Joëlle Pineau","is_ca":true},{"name":"Aviv Tamar","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0465390705497981,"gpt":0.3022379049415592,"spread":0.2556988343917611,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004878199,0.001806153,0.002751805,0.002339058,0.0006884105,0.003515098,0.002922326,0.002894475,0.006918041],"category_scores_gemma":[0.01509955,0.001307841,0.001279284,0.004347405,0.002017614,0.004233444,0.001999738,0.003736906,0.002949983],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002382739,"about_ca_system_score_gemma":0.003210425,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005603018,"about_ca_topic_score_gemma":0.00400937,"domain_scores_codex":[0.9968479,0.001323011,0.0002122427,0.0004120325,0.001097947,0.0001068429],"domain_scores_gemma":[0.9904035,0.007986934,0.000220332,0.0004286645,0.0008227439,0.0001377627],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00006478524,0.0001390015,0.001281765,0.002274508,0.0001592148,0.00006810849,0.0001853246,0.05350136,0.0003125357,0.3446048,0.01871744,0.5786912],"study_design_scores_gemma":[0.00006125388,0.00009670688,0.0009556268,0.001401176,0.00009139439,0.0003002932,0.00009830664,0.2135358,0.0005544247,0.5736824,0.2091278,0.00009489838],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"review","genre_scores_codex":[0.001584646,0.2261449,0.7485257,0.003841139,0.0005675985,0.0001080122,0.0002607502,0.000406917,0.01856046],"genre_scores_gemma":[0.09047037,0.5075034,0.3839407,0.001897743,0.003980792,0.0006423852,0.000834936,0.0004903558,0.0102394],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.006918041,"threshold_uncertainty_score":0.02579868,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2523728418","doi":"10.1609/aaai.v31i1.10916","title":"The Option-Critic Architecture","year":2017,"lang":"en","type":"preprint","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":209,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"Fonds de recherche du Québec – Nature et technologies; Natural Sciences and Engineering Research Council of Canada","keywords":"Reinforcement learning; Flexibility (engineering); Computer science; Architecture; Abstraction; Key (lock); Artificial intelligence; Economics; Computer security; Management; Epistemology","authors":[{"name":"Pierre‐Luc Bacon","is_ca":true},{"name":"Jean Harb","is_ca":true},{"name":"Doina Precup","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08507794004948784,"gpt":0.3192055271439572,"spread":0.2341275870944694,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009809321,0.0008233829,0.0006473402,0.0003459276,0.0004679998,0.001291565,0.001527719,0.001421225,0.004629966],"category_scores_gemma":[0.004000276,0.0006060058,0.0006058979,0.0003526702,0.001697263,0.002424369,0.001848369,0.003288094,0.0009195589],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009343338,"about_ca_system_score_gemma":0.001417995,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002643663,"about_ca_topic_score_gemma":0.003257169,"domain_scores_codex":[0.9994487,0.000161813,0.0000298946,0.0001448315,0.0001618101,0.0000529112],"domain_scores_gemma":[0.9990978,0.0004315622,0.00007432087,0.0001556578,0.0001434311,0.00009728146],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00008746639,0.00003673113,0.0006332994,0.0001013999,0.00006939502,0.0001662118,0.0001141666,0.5939296,0.003040292,0.3473042,0.003045764,0.05147145],"study_design_scores_gemma":[0.0000179705,0.00002198842,0.00009102263,0.00001684622,0.00001431791,0.0000402838,0.000005984923,0.8564832,0.0005388039,0.140002,0.002754554,0.0000130512],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01001272,0.0004054291,0.9754112,0.001000065,0.00009678536,0.00004522463,0.00008872127,0.0005385211,0.01240119],"genre_scores_gemma":[0.7117746,0.0007622546,0.2723404,0.0004591023,0.0001331146,0.0002833849,0.0001809902,0.0001588672,0.0139074],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004629966,"threshold_uncertainty_score":0.0154888,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2174786457","doi":"10.48550/arxiv.1511.06342","title":"Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning","year":2015,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":208,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Reinforcement learning; Computer science; Exploit; Artificial intelligence; Transfer of learning; Set (abstract data type); Task (project management); Machine learning; Engineering","authors":[{"name":"Emilio Parisotto","is_ca":true},{"name":"Jimmy Ba","is_ca":true},{"name":"Ruslan Salakhutdinov","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.07661995159032055,"gpt":0.1959416640452457,"spread":0.1193217124549251,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00127193,0.0007304588,0.0006343292,0.0002545187,0.0002718916,0.0006206107,0.001766773,0.001013901,0.002622169],"category_scores_gemma":[0.003652343,0.0003778806,0.0004145399,0.0002616442,0.001109794,0.001295918,0.001382179,0.001803728,0.0005013078],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008899579,"about_ca_system_score_gemma":0.001061716,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002132785,"about_ca_topic_score_gemma":0.002278087,"domain_scores_codex":[0.9995056,0.0002126898,0.00001783684,0.00009817468,0.0001169827,0.00004861876],"domain_scores_gemma":[0.9991575,0.0004173838,0.0000987707,0.0001571937,0.00008735342,0.0000818663],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001225323,0.0001154397,0.0007952304,0.00007630991,0.00006381912,0.0001000521,0.00007857683,0.8703164,0.003032673,0.05194716,0.003002346,0.07034942],"study_design_scores_gemma":[0.000007421662,0.00001925154,0.00002941905,0.000002640205,0.000002238069,0.000008883296,0.000001998966,0.9875773,0.0004783437,0.01132845,0.0005415728,0.000002564677],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01608139,0.0001872172,0.9786723,0.000318353,0.00006556316,0.00005294691,0.00004377806,0.0009716284,0.003606827],"genre_scores_gemma":[0.7859378,0.0001920912,0.206657,0.0002254105,0.00005211891,0.0002368795,0.0001229072,0.0001493791,0.006426381],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.002622169,"threshold_uncertainty_score":0.008772016,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W190427941","doi":"10.20965/jaciii.2006.p0578","title":"Opposition-Based Reinforcement Learning","year":2006,"lang":"en","type":"article","venue":"Journal of Advanced Computational Intelligence and Intelligent Informatics","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":207,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Reinforcement learning; Computer science; Expediting; Artificial intelligence; A priori and a posteriori; Probabilistic logic; Grid; Machine learning; Opposition (politics); Convergence (economics); Learning classifier system; Engineering; Mathematics","authors":[{"name":"Hamid R. Tizhoosh","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01614136464924268,"gpt":0.2628008458279594,"spread":0.2466594811787167,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001305042,0.0007572739,0.00137536,0.0004510494,0.0003827406,0.0007528921,0.001312855,0.0009079622,0.002439095],"category_scores_gemma":[0.004146397,0.0002634005,0.0004754123,0.000427672,0.001189939,0.0007089592,0.001078284,0.001154256,0.0003888851],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006690928,"about_ca_system_score_gemma":0.000776189,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002104882,"about_ca_topic_score_gemma":0.001569994,"domain_scores_codex":[0.9992041,0.0003349317,0.00004108679,0.0001116092,0.0002251142,0.00008315192],"domain_scores_gemma":[0.9983249,0.001059433,0.0001702817,0.0001012262,0.0002536059,0.00009047782],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001603872,0.0001495115,0.0009686153,0.0001532397,0.00009311277,0.0001595781,0.00009601682,0.8630928,0.002227417,0.03708625,0.001675329,0.09413773],"study_design_scores_gemma":[0.00004206536,0.00008306065,0.00008467263,0.000009052339,0.000009039812,0.00003193262,0.000006294493,0.9886839,0.0004722035,0.009446564,0.001123047,0.000008128266],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01372192,0.0002728781,0.9801165,0.000162988,0.00006880312,0.00009176248,0.00002580292,0.0003130999,0.005226076],"genre_scores_gemma":[0.8651396,0.0003277849,0.129491,0.0002459216,0.00005394258,0.0003617169,0.00008603418,0.00004789277,0.004246194],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.002439095,"threshold_uncertainty_score":0.008159518,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3175558129","doi":"10.1609/aaai.v35i12.17276","title":"Improving Sample Efficiency in Model-Free Reinforcement Learning from Images","year":2021,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":201,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Robustness (evolution); Computer science; Artificial intelligence; Stability (learning theory); Machine learning; Encoder; Representation (politics); Noise (video); Code (set theory); Image (mathematics)","authors":[{"name":"Denis Yarats","is_ca":false},{"name":"Amy Zhang","is_ca":true},{"name":"Ilya Kostrikov","is_ca":false},{"name":"Brandon Amos","is_ca":false},{"name":"Joëlle Pineau","is_ca":true},{"name":"Rob Fergus","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01918541106757507,"gpt":0.2364670789210525,"spread":0.2172816678534774,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00287718,0.001089397,0.001490106,0.0004586175,0.0005317111,0.0009690191,0.00191144,0.001345246,0.002587386],"category_scores_gemma":[0.01377756,0.0007505636,0.0005369825,0.0003158504,0.001755786,0.002083955,0.001910697,0.002246659,0.0005209126],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001177835,"about_ca_system_score_gemma":0.001638619,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0048034,"about_ca_topic_score_gemma":0.005092191,"domain_scores_codex":[0.9992006,0.0003284492,0.00003865067,0.000173811,0.0001601231,0.00009839044],"domain_scores_gemma":[0.9949868,0.00358998,0.0003471301,0.0005897412,0.0003096294,0.0001767602],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002345487,0.000134606,0.00107486,0.00009412781,0.00004032804,0.00007708144,0.0001054798,0.9261957,0.002501302,0.01738233,0.0009957497,0.05116394],"study_design_scores_gemma":[0.00001375428,0.00002473642,0.00004657449,0.000005340339,0.00000283055,0.000007565566,0.000003567057,0.9945098,0.000486509,0.004798462,0.00009816155,0.000002773098],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0382784,0.0001822629,0.9582589,0.0003032137,0.00002585605,0.00005384235,0.00003297544,0.001095519,0.001768987],"genre_scores_gemma":[0.8619704,0.00009982718,0.1352307,0.0002118733,0.00002748986,0.0001516864,0.0001102942,0.0002401543,0.001957451],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.0048034,"threshold_uncertainty_score":0.01521611,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2102847492","doi":"10.1145/1390156.1390286","title":"Apprenticeship learning using linear programming","year":2008,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":194,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Apprenticeship; Markov decision process; Computer science; Linear programming; Solver; Frame (networking); Markov process; Mathematical optimization; Process (computing); Markov chain; Artificial intelligence; Machine learning; Algorithm; Mathematics; Statistics","authors":[{"name":"Michael Bowling","is_ca":true},{"name":"Robert E. Schapire","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06668564856124883,"gpt":0.2809145654987666,"spread":0.2142289169375178,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001698974,0.001259978,0.00116349,0.0005045889,0.0005508468,0.001111416,0.001754426,0.001565982,0.004719628],"category_scores_gemma":[0.006134431,0.0007459231,0.0007552595,0.0004689477,0.001288989,0.001908834,0.002486797,0.002874608,0.0008589837],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008756542,"about_ca_system_score_gemma":0.001401907,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002640314,"about_ca_topic_score_gemma":0.002590836,"domain_scores_codex":[0.9989291,0.0004313433,0.00004962811,0.0002936368,0.0001788843,0.0001174421],"domain_scores_gemma":[0.9971083,0.002159883,0.0001546948,0.0001615151,0.0002787863,0.0001369018],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001041654,0.0002677435,0.0009396519,0.0001210812,0.00005076439,0.0001277712,0.0001699147,0.824541,0.0013003,0.03321979,0.001979405,0.1371785],"study_design_scores_gemma":[0.0000124906,0.00004377675,0.00003844101,0.000009801571,0.000004383404,0.0000185891,0.00001338601,0.981109,0.0007162297,0.01737904,0.0006501589,0.000004834195],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01489309,0.0001905903,0.9809168,0.0002281713,0.00002122474,0.0000673989,0.00001861235,0.0005753303,0.003088772],"genre_scores_gemma":[0.545786,0.0003493213,0.4444511,0.000368574,0.00006750543,0.0005186318,0.0001895455,0.0002028939,0.008066266],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004719628,"threshold_uncertainty_score":0.01578867,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1998172110","doi":"10.1007/s10479-005-5732-z","title":"Basis Function Adaptation in Temporal Difference Reinforcement Learning","year":2005,"lang":"en","type":"article","venue":"Annals of Operations Research","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":190,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Markov decision process; Bellman equation; Temporal difference learning; Basis function; Function approximation; Mathematical optimization; Basis (linear algebra); Computer science; Theory of computation; Q-learning; Convergence (economics); Markov process; Mathematics; Artificial intelligence; Algorithm; Artificial neural network","authors":[{"name":"Ishai Menache","is_ca":false},{"name":"Shie Mannor","is_ca":true},{"name":"Nahum Shimkin","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2255396635006515,"gpt":0.4118928531180281,"spread":0.1863531896173766,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002156965,0.0004628069,0.001036601,0.0002996183,0.0003106451,0.0008035448,0.001197531,0.001277319,0.002481228],"category_scores_gemma":[0.007963539,0.0004517107,0.0003984519,0.0004819992,0.001156757,0.001410461,0.00100418,0.001793241,0.0002447949],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007637889,"about_ca_system_score_gemma":0.0008450272,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003736595,"about_ca_topic_score_gemma":0.002076547,"domain_scores_codex":[0.9995046,0.0002457621,0.00002453999,0.00007739335,0.00009781486,0.00004990099],"domain_scores_gemma":[0.9972149,0.002173254,0.0001034829,0.0001162979,0.0003095017,0.00008235032],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001493416,0.00009672557,0.000505315,0.00007805336,0.00005136018,0.00004578877,0.0000649386,0.8295184,0.001598138,0.1031067,0.001262192,0.06352302],"study_design_scores_gemma":[0.000007551465,0.00001214087,0.00003912542,0.000002308833,0.000003143494,0.000004201376,0.000001976132,0.9855955,0.0001063757,0.0140952,0.0001297879,0.000002753273],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02904971,0.0006060337,0.9670018,0.0003614545,0.0001261782,0.00002196214,0.00002153561,0.00009687037,0.002714414],"genre_scores_gemma":[0.8872939,0.0006511523,0.1028082,0.0001924876,0.0001174554,0.0001765247,0.00006666827,0.00008739467,0.008606263],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003736595,"threshold_uncertainty_score":0.0114072,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3117215073","doi":"10.1613/jair.1.13673","title":"Towards Continual Reinforcement Learning: A Review and Perspectives","year":2022,"lang":"en","type":"review","venue":"Journal of Artificial Intelligence Research","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":180,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal; McGill University","funders":"Canada Excellence Research Chairs, Government of Canada; Canadian Institute for Advanced Research","keywords":"Reinforcement learning; Computer science; Scope (computer science); Artificial intelligence; Bridging (networking); Taxonomy (biology); Function (biology); Management science; Engineering","authors":[{"name":"Khimya Khetarpal","is_ca":true},{"name":"Matthew Riemer","is_ca":true},{"name":"Irina Rish","is_ca":true},{"name":"Doina Precup","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3537488428002021,"gpt":0.4758490705427069,"spread":0.1221002277425048,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00179616,0.001154558,0.001409557,0.002675164,0.0004074779,0.002165541,0.001558592,0.001961206,0.00389698],"category_scores_gemma":[0.003938644,0.0006143135,0.0007157455,0.00442322,0.00113277,0.003142055,0.001051206,0.002958983,0.001991165],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001330001,"about_ca_system_score_gemma":0.002184543,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002105322,"about_ca_topic_score_gemma":0.001865717,"domain_scores_codex":[0.9994215,0.0001382155,0.00008101267,0.00014846,0.0001772007,0.00003373698],"domain_scores_gemma":[0.996796,0.002390386,0.000168001,0.00007519202,0.000472509,0.00009806215],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00007687198,0.0001449571,0.0003916822,0.02293243,0.0001241256,0.0001457375,0.0002302625,0.003641831,0.0005828555,0.0431855,0.01576897,0.9127749],"study_design_scores_gemma":[0.00003041949,0.0002574795,0.001106333,0.01509455,0.0001905615,0.0009705718,0.0002936817,0.002559174,0.0006364376,0.03512603,0.9436439,0.0000908437],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0001791507,0.9949846,0.002204542,0.0006094696,0.0001689209,0.00000709577,0.00001005789,0.00001718403,0.001819003],"genre_scores_gemma":[0.002637474,0.99426,0.001881602,0.00036713,0.000347138,0.00001608421,0.00002534957,0.000008224983,0.0004569902],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.00389698,"threshold_uncertainty_score":0.01303673,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2097113539","doi":"10.1613/jair.898","title":"Accelerating Reinforcement Learning through Implicit Imitation","year":2003,"lang":"en","type":"article","venue":"Journal of Artificial Intelligence Research","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":176,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto; University of British Columbia","funders":"Instituto de Ciencias del Mar y Limnología, Universidad Nacional Autónoma de México; Natural Sciences and Engineering Research Council of Canada","keywords":"Imitation; Reinforcement learning; Observability; Computer science; Convergence (economics); Action (physics); Space (punctuation); Artificial intelligence; State space; Reinforcement; Value (mathematics); Human–computer interaction; Machine learning; Psychology; Mathematics; Social psychology","authors":[{"name":"Blaine Price","is_ca":true},{"name":"Craig Boutilier","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2541885736812509,"gpt":0.4324161648659641,"spread":0.1782275911847133,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001404605,0.0006531003,0.0006546348,0.0002413794,0.0002388503,0.0005002687,0.001374361,0.0007705024,0.001365311],"category_scores_gemma":[0.006951879,0.0003390074,0.0003097387,0.0002146271,0.001272889,0.001375793,0.001438488,0.001236566,0.0002230647],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005211018,"about_ca_system_score_gemma":0.0007868782,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001665948,"about_ca_topic_score_gemma":0.00133283,"domain_scores_codex":[0.9993852,0.0002355182,0.00002810632,0.0001086033,0.0001555496,0.00008695967],"domain_scores_gemma":[0.9958956,0.002361286,0.0004724326,0.0008455461,0.0002799573,0.0001452509],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002196725,0.0001504349,0.001664664,0.00008514465,0.00003645266,0.0001354901,0.0001825914,0.9001032,0.009209661,0.03314264,0.0003907284,0.05467931],"study_design_scores_gemma":[0.00002473221,0.00006284487,0.00009283708,0.000003032261,0.000004061013,0.00001602996,0.000004221215,0.9924014,0.001091234,0.006090937,0.0002048386,0.000003915628],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1190772,0.00008316888,0.877167,0.000175195,0.00002136296,0.00005266925,0.00001648662,0.0007377224,0.002669093],"genre_scores_gemma":[0.9457831,0.00004690671,0.05264583,0.00003366066,0.000008167231,0.00006776935,0.00001938844,0.00002341401,0.001371906],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.001665948,"threshold_uncertainty_score":0.007428288,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W13294968","doi":"10.1016/0021-8707(56)90033-8","title":"Toward Off-Policy Learning Control with Function Approximation","year":2010,"lang":"en","type":"article","venue":"International Conference on Machine Learning","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":175,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Temporal difference learning; Function approximation; Approximation algorithm; Function (biology); Computer science; Linear approximation; Bellman equation; Optimal control; Extension (predicate logic); Mathematical optimization; Control (management); Artificial intelligence; Mathematics; Reinforcement learning; Artificial neural network; Nonlinear system","authors":[{"name":"Hamid Reza Maei","is_ca":true},{"name":"Csaba Szepesv ri","is_ca":true},{"name":"Shalabh Bhatnagar","is_ca":false},{"name":"Richard Sutton","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02266731972468504,"gpt":0.2706007747695721,"spread":0.247933455044887,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002936141,0.001629104,0.001860193,0.000838263,0.0005538244,0.00166337,0.002049875,0.001860138,0.003300941],"category_scores_gemma":[0.008435267,0.0007002832,0.0009506204,0.0006141168,0.002189066,0.001531674,0.002789471,0.003554289,0.0007983472],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002037738,"about_ca_system_score_gemma":0.002279104,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00585327,"about_ca_topic_score_gemma":0.002625465,"domain_scores_codex":[0.9987147,0.0003347325,0.00006135148,0.0002539192,0.0004526936,0.000182676],"domain_scores_gemma":[0.9964526,0.002346283,0.0002544181,0.0002799712,0.0005250287,0.0001417132],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001153535,0.0001036054,0.0004194267,0.00009093137,0.00003236252,0.00005908406,0.0001201643,0.8669133,0.001411857,0.05506869,0.001403967,0.07426123],"study_design_scores_gemma":[0.000007179633,0.00001931516,0.00001368817,0.000006413277,0.000001903528,0.000005895445,0.000002909148,0.991289,0.0002004786,0.008099364,0.0003509354,0.000002805635],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.003765274,0.0001377512,0.9931476,0.0001473179,0.00003939305,0.0000352694,0.00001391504,0.0003708324,0.002342661],"genre_scores_gemma":[0.6216077,0.0003366968,0.3683889,0.0007247206,0.0001374821,0.0004586868,0.0001837131,0.0004023894,0.007759728],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.00585327,"threshold_uncertainty_score":0.01552796,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3092156990","doi":"10.1613/jair.1.12440","title":"Reward Machines: Exploiting Reward Function Structure in Reinforcement Learning","year":2022,"lang":"en","type":"article","venue":"Journal of Artificial Intelligence Research","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":172,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Vector Institute; University of Toronto","funders":"Natural Sciences and Engineering Research Council of Canada; University of Toronto; Government of Canada; Canadian Institute for Advanced Research; Vector Institute; Microsoft Research","keywords":"Reinforcement learning; Computer science; Exploit; Counterfactual thinking; Function (biology); Artificial intelligence; Finite-state machine; Machine learning; Algorithm; Psychology","authors":[{"name":"Rodrigo Toro Icarte","is_ca":true},{"name":"Toryn Q. Klassen","is_ca":true},{"name":"Richard Valenzano","is_ca":false},{"name":"Sheila A. McIlraith","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1113564636583909,"gpt":0.3745631904237698,"spread":0.2632067267653789,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002877827,0.0008595068,0.0008421073,0.0005075395,0.0004214588,0.001370213,0.001430926,0.001263346,0.003297319],"category_scores_gemma":[0.01116771,0.0005888832,0.0008212834,0.0004891472,0.002738575,0.002801512,0.001508486,0.002715355,0.000561111],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001035382,"about_ca_system_score_gemma":0.001184069,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001448808,"about_ca_topic_score_gemma":0.001353948,"domain_scores_codex":[0.9983287,0.0009114333,0.00007595006,0.0002666799,0.0003147154,0.0001025888],"domain_scores_gemma":[0.9943669,0.004296996,0.0003662179,0.0006042265,0.0002319131,0.0001337995],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002764249,0.0001254525,0.001026875,0.0001839499,0.00006096576,0.0001488147,0.0002818138,0.6184499,0.005538596,0.2792026,0.001410014,0.09329476],"study_design_scores_gemma":[0.00002804241,0.00005976033,0.00006505713,0.00002120178,0.000009422978,0.00002267068,0.000007260441,0.896973,0.002085738,0.09931213,0.001402336,0.00001328738],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.004660038,0.00008334038,0.9937045,0.0001250549,0.00001676991,0.00003502243,0.00002529977,0.0005355071,0.0008144121],"genre_scores_gemma":[0.4603901,0.0002563169,0.5362601,0.0002303978,0.00005716171,0.0003757845,0.0001056874,0.0002951884,0.002029386],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003297319,"threshold_uncertainty_score":0.01521963,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2134042548","doi":"","title":"Convergent Temporal-Difference Learning with Arbitrary Smooth Function Approximation","year":2009,"lang":"en","type":"article","venue":"Neural Information Processing Systems","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":168,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta; McGill University","funders":"","keywords":"Temporal difference learning; Function approximation; Stochastic approximation; Markov decision process; Mathematics; Function (biology); Stochastic gradient descent; Bellman equation; Mathematical optimization; Convergence (economics); Nonlinear system; Approximation algorithm; Artificial neural network; Gradient descent; Approximation error; Markov process; Rate of convergence; Algorithm; Applied mathematics; Reinforcement learning; Computer science; Artificial intelligence; Key (lock)","authors":[{"name":"Shalabh Bhatnagar","is_ca":false},{"name":"Doina Precup","is_ca":true},{"name":"David Silver","is_ca":true},{"name":"Richard S. Sutton","is_ca":true},{"name":"Hamid Reza Maei","is_ca":true},{"name":"Csaba Szepesvári","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01454759173183138,"gpt":0.2203356894460717,"spread":0.2057880977142404,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002428547,0.0008440595,0.001028083,0.0005100523,0.0004018143,0.001091728,0.001799633,0.001451297,0.002872385],"category_scores_gemma":[0.008947497,0.0004719117,0.0008248786,0.0005218561,0.00176298,0.001887123,0.002068795,0.002300656,0.0005582396],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001347799,"about_ca_system_score_gemma":0.001307006,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003179274,"about_ca_topic_score_gemma":0.001936952,"domain_scores_codex":[0.9993286,0.0001756819,0.00004290179,0.0001358357,0.0002541276,0.00006286525],"domain_scores_gemma":[0.9976478,0.001377467,0.0001821658,0.000255222,0.0004383454,0.00009886328],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001182077,0.00006276508,0.0005913373,0.0001536661,0.00004692168,0.00009520556,0.0001263292,0.7048174,0.002621078,0.2241525,0.001096876,0.06611783],"study_design_scores_gemma":[0.000006469439,0.00001728161,0.00002152804,0.000005862671,0.000002701945,0.0000128072,0.00000210343,0.9857782,0.0004800543,0.01313381,0.0005346536,0.000004486166],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003118963,0.0001842242,0.9950233,0.0001141731,0.00004114212,0.00002142456,0.00001278687,0.00008456127,0.001399549],"genre_scores_gemma":[0.3630849,0.0004497861,0.6290939,0.0002417156,0.00008954435,0.0002337302,0.0000930766,0.0001302213,0.006583024],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003179274,"threshold_uncertainty_score":0.01284355,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2964295739","doi":"","title":"Imagination-Augmented Agents for Deep Reinforcement Learning","year":2017,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":163,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Reinforcement learning; Robustness (evolution); Computer science; Artificial intelligence; Construct (python library); Policy learning; Machine learning; Contrast (vision); Deep learning; Context (archaeology); Architecture","authors":[{"name":"Sébastien Racanière","is_ca":false},{"name":"Théophane Weber","is_ca":false},{"name":"David Reichert","is_ca":false},{"name":"Lars Buesing","is_ca":false},{"name":"Arthur Guez","is_ca":false},{"name":"Danilo Jimenez Rezende","is_ca":false},{"name":"Adrià Puigdomènech Badia","is_ca":false},{"name":"Oriol Vinyals","is_ca":false},{"name":"Nicolas Heess","is_ca":false},{"name":"Yujia Li","is_ca":true},{"name":"Razvan Pascanu","is_ca":false},{"name":"Peter Battaglia","is_ca":false},{"name":"Demis Hassabis","is_ca":false},{"name":"David Silver","is_ca":false},{"name":"Daan Wierstra","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0722518834787979,"gpt":0.2207498508139353,"spread":0.1484979673351374,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000637539,0.001006778,0.0006190591,0.0002275937,0.0002907305,0.0007924768,0.001436968,0.0009162329,0.004467667],"category_scores_gemma":[0.002716118,0.0004008099,0.0005140908,0.0002461357,0.00103807,0.001286153,0.001522767,0.002684949,0.0006475075],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008602045,"about_ca_system_score_gemma":0.001016545,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002402872,"about_ca_topic_score_gemma":0.003583369,"domain_scores_codex":[0.9997209,0.0001004831,0.00001607565,0.00006408172,0.00006884366,0.00002956691],"domain_scores_gemma":[0.9993116,0.0003604277,0.0000783715,0.0001104065,0.00007455381,0.0000645862],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001168091,0.000102459,0.0006961056,0.000158297,0.00007477199,0.0001000536,0.00009857475,0.7695029,0.003570453,0.1325376,0.003398571,0.08964347],"study_design_scores_gemma":[0.00001066638,0.00002529468,0.00002964965,0.000009672192,0.000005551562,0.000009865706,0.000003142516,0.9611621,0.0006922683,0.0364928,0.001553781,0.000005235242],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.005795544,0.0003030326,0.9899272,0.0002455791,0.00007256204,0.00002910322,0.00006015157,0.0006514946,0.002915336],"genre_scores_gemma":[0.630657,0.0005337938,0.3615981,0.0002821274,0.00009173816,0.0003114367,0.0002295709,0.0002038614,0.00609235],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004467667,"threshold_uncertainty_score":0.01494581,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2011233848","doi":"10.1145/1143844.1143901","title":"Automatic basis function construction for approximate dynamic programming and reinforcement learning","year":2006,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":162,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Bellman equation; Markov decision process; Reinforcement learning; Computer science; Basis (linear algebra); Function approximation; Dynamic programming; Curse of dimensionality; Basis function; Mathematical optimization; State space; Temporal difference learning; Markov process; Dimensionality reduction; Q-learning; Function (biology); Space (punctuation); Artificial intelligence; Algorithm; Mathematics; Artificial neural network","authors":[{"name":"Philipp W. Keller","is_ca":true},{"name":"Shie Mannor","is_ca":true},{"name":"Doina Precup","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.007772714293839559,"gpt":0.2228768719720251,"spread":0.2151041576781855,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002072582,0.0007558373,0.001500033,0.0008795962,0.0005583897,0.0009049407,0.001462673,0.001387208,0.002191551],"category_scores_gemma":[0.007400156,0.0006413195,0.0008307231,0.0007980954,0.0009992112,0.00160749,0.001556635,0.002237096,0.000841505],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007694737,"about_ca_system_score_gemma":0.001032389,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002143878,"about_ca_topic_score_gemma":0.001910257,"domain_scores_codex":[0.998953,0.000455419,0.00004715156,0.000139261,0.0003253942,0.00007983958],"domain_scores_gemma":[0.9979037,0.001176191,0.0001447868,0.0003154153,0.000389514,0.00007047344],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006899658,0.0001150263,0.0005144865,0.0001170849,0.00004535867,0.00006251086,0.0001120284,0.6976379,0.004512556,0.1034289,0.001401951,0.1919833],"study_design_scores_gemma":[0.000003640242,0.000009327377,0.00001384044,0.000003508206,0.000001371911,0.000005116886,0.000002033257,0.9867373,0.0004822041,0.01246651,0.0002718017,0.000003310081],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.002335824,0.00004467862,0.9971104,0.0000330998,0.00001098602,0.00001140961,0.000007413537,0.0001383746,0.0003079305],"genre_scores_gemma":[0.2030215,0.0001858727,0.7945531,0.00007054793,0.00004267281,0.0003371348,0.000122915,0.0002294353,0.001436725],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.002191551,"threshold_uncertainty_score":0.010961,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2144283793","doi":"","title":"Bounded Finite State Controllers","year":2003,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":162,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Bounded function; Mathematical optimization; Observable; Controller (irrigation); State space; Computer science; Mathematics; State (computer science); Vulnerability (computing); Applied mathematics; Control theory (sociology); Algorithm; Control (management); Artificial intelligence; Mathematical analysis","authors":[{"name":"Pascal Poupart","is_ca":true},{"name":"Craig Boutilier","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01215492872489436,"gpt":0.2210237985235338,"spread":0.2088688697986395,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006867796,0.0007668242,0.0008615481,0.0004221516,0.000443931,0.001299382,0.001917917,0.001054826,0.005575228],"category_scores_gemma":[0.003418227,0.0003753855,0.0005735704,0.0004076343,0.0008000218,0.001461464,0.001379057,0.001682222,0.001354758],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007866702,"about_ca_system_score_gemma":0.001599949,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003069765,"about_ca_topic_score_gemma":0.003458071,"domain_scores_codex":[0.9991606,0.0001522457,0.00003911672,0.0001499501,0.000419095,0.00007894171],"domain_scores_gemma":[0.9990871,0.0004504045,0.00007860207,0.0001658428,0.000161923,0.00005609583],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00009187114,0.00005964388,0.0002760066,0.0001384507,0.000039732,0.0001147919,0.00007034459,0.7538344,0.004368441,0.1084189,0.003594144,0.1289932],"study_design_scores_gemma":[0.000009455257,0.00001614142,0.00001600779,0.000008560087,0.000004678268,0.00001797946,0.00000248547,0.9850991,0.001107996,0.009450977,0.004262158,0.000004547017],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001458383,0.0001174233,0.9949557,0.00005007108,0.0000475404,0.00002347422,0.00003324684,0.0008231564,0.002491054],"genre_scores_gemma":[0.2992181,0.0004861353,0.6911644,0.0001816398,0.00006552948,0.0003884984,0.0003008672,0.0002181555,0.007976584],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005575228,"threshold_uncertainty_score":0.01865101,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3081310128","doi":"10.3390/electronics9091363","title":"A Survey of Multi-Task Deep Reinforcement Learning","year":2020,"lang":"en","type":"article","venue":"Electronics","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":160,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Ontario Tech University","funders":"","keywords":"Reinforcement learning; Computer science; Artificial intelligence; Forgetting; Deep learning; Transfer of learning; Task (project management); Active learning (machine learning); Machine learning; Engineering","authors":[{"name":"Nelson Vithayathil Varghese","is_ca":true},{"name":"Qusay H. Mahmoud","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0304471569031292,"gpt":0.2600883677161803,"spread":0.2296412108130511,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001462719,0.001290274,0.001357449,0.0008440828,0.000294025,0.00145782,0.001702462,0.001297777,0.003347606],"category_scores_gemma":[0.00310717,0.0006225387,0.0007290186,0.001564962,0.0005669749,0.001753833,0.001176823,0.00155126,0.0009669823],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001125623,"about_ca_system_score_gemma":0.001258485,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00313265,"about_ca_topic_score_gemma":0.002287172,"domain_scores_codex":[0.999347,0.0001656148,0.00007665298,0.0001512569,0.0002049662,0.00005450429],"domain_scores_gemma":[0.9989974,0.0005849884,0.00005927878,0.00009096216,0.000214616,0.00005276046],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001269543,0.000174405,0.001569113,0.001311505,0.0001588777,0.00008886593,0.00008758921,0.1924558,0.001289473,0.03299874,0.007037034,0.7627016],"study_design_scores_gemma":[0.00003820771,0.0002977405,0.001066125,0.0005622506,0.00009063315,0.0002142858,0.00007100674,0.885215,0.002366213,0.04919489,0.06082463,0.00005907372],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"review","genre_scores_codex":[0.009830999,0.1674594,0.7975252,0.002021105,0.0005118909,0.0001368616,0.0001966879,0.0009007192,0.02141696],"genre_scores_gemma":[0.4763805,0.2443122,0.2540784,0.001716045,0.001611258,0.0005568177,0.0009250375,0.0003999414,0.02001974],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.003347606,"threshold_uncertainty_score":0.01119888,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W36013382","doi":"10.3390/life12081203","title":"A decision-theoretic approach to task assistance for persons with dementia","year":2005,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":160,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Toronto Rehabilitation Institute; University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Partially observable Markov decision process; Dementia; Task (project management); Personalization; Computer science; Independence (probability theory); Markov decision process; Process (computing); Cognition; Markov process; Artificial intelligence; Human–computer interaction; Cognitive psychology; Risk analysis (engineering); Machine learning; Psychology; Disease; Markov model; Markov chain; Medicine; Engineering; Neuroscience; Mathematics","authors":[{"name":"Jennifer Boger","is_ca":false},{"name":"Pascal Poupart","is_ca":true},{"name":"Jesse Hoey","is_ca":false},{"name":"Craig Boutilier","is_ca":false},{"name":"Geoff Fernie","is_ca":true},{"name":"Alex Mihailidis","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0136587460076659,"gpt":0.2431900778426254,"spread":0.2295313318349596,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002767871,0.001082612,0.0009786194,0.0007107405,0.0007727061,0.001376983,0.001656038,0.001889561,0.009602443],"category_scores_gemma":[0.007836957,0.000432859,0.0007551829,0.0004676487,0.001343886,0.001406946,0.001987336,0.001652998,0.0007599468],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001734634,"about_ca_system_score_gemma":0.002799641,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005584621,"about_ca_topic_score_gemma":0.004793356,"domain_scores_codex":[0.9987937,0.0007371953,0.00005671373,0.0001695079,0.0001199293,0.0001230238],"domain_scores_gemma":[0.9956406,0.003574321,0.0001564662,0.00008509336,0.0002762318,0.0002672881],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004324868,0.000445336,0.002028493,0.0002317336,0.0001138494,0.000227908,0.0004844174,0.8385659,0.0004229219,0.06572887,0.004219548,0.08709846],"study_design_scores_gemma":[0.00008404198,0.0001364497,0.0002320106,0.00003758199,0.00002019387,0.00004042736,0.0001234653,0.9018704,0.0001527546,0.09579985,0.001485567,0.00001713682],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.05771565,0.0007423133,0.9090068,0.00553906,0.0001588381,0.0003796351,0.0002035982,0.0003024825,0.0259517],"genre_scores_gemma":[0.8420443,0.0006342275,0.1484325,0.0004536794,0.0001496532,0.0009457458,0.0001976587,0.00004781365,0.007094386],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.009602443,"threshold_uncertainty_score":0.03212345,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2136602922","doi":"","title":"Incremental Natural Actor-Critic Algorithms","year":2007,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":157,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Temporal difference learning; Computer science; Convergence (economics); Bellman equation; Mathematical proof; Function approximation; Algorithm; Variance (accounting); Stochastic gradient descent; Function (biology); Rate of convergence; Gradient descent; Artificial intelligence; Mathematical optimization; Mathematics; Artificial neural network","authors":[{"name":"Shalabh Bhatnagar","is_ca":false},{"name":"Mohammad Ghavamzadeh","is_ca":true},{"name":"Mark Lee","is_ca":true},{"name":"Richard S. Sutton","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01335400574327761,"gpt":0.2696630519567899,"spread":0.2563090462135123,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001688558,0.001099574,0.001165577,0.0006874039,0.0005608377,0.001052174,0.002751624,0.001226707,0.005386609],"category_scores_gemma":[0.005687376,0.000598675,0.000713178,0.0004568384,0.001125904,0.001880987,0.002006615,0.001799894,0.001100778],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001128127,"about_ca_system_score_gemma":0.001498108,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002618544,"about_ca_topic_score_gemma":0.003621663,"domain_scores_codex":[0.9989297,0.0003148904,0.00006236492,0.0002042782,0.0003848215,0.0001038833],"domain_scores_gemma":[0.9983029,0.0007714443,0.0001519032,0.0002621893,0.0003885812,0.0001229923],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001894272,0.0001495774,0.0008266749,0.0002589943,0.00009397227,0.0001327579,0.0001808584,0.5745934,0.002480498,0.2007016,0.008456803,0.2119353],"study_design_scores_gemma":[0.00002261327,0.00002920196,0.00005919015,0.000007855203,0.000009709608,0.00003343178,0.000005254221,0.9742023,0.0005401172,0.0216204,0.003459274,0.00001058325],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003245099,0.0002210852,0.9911856,0.0001399604,0.00008848729,0.0000699779,0.00003736457,0.000518475,0.004493989],"genre_scores_gemma":[0.29504,0.0003950911,0.6914247,0.0002830343,0.0001178215,0.0005111451,0.0002010717,0.0001916293,0.01183543],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005386609,"threshold_uncertainty_score":0.01802003,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2785948534","doi":"","title":"NerveNet: Learning Structured Policy with Graph Neural Networks","year":2018,"lang":"en","type":"article","venue":"International Conference on Learning Representations","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":155,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Reinforcement learning; Concatenation (mathematics); Computer science; Transfer of learning; Artificial intelligence; Graph; Benchmarking; Machine learning; Artificial neural network; Control (management); Theoretical computer science; Mathematics","authors":[{"name":"Tingwu Wang","is_ca":true},{"name":"Renjie Liao","is_ca":true},{"name":"Jimmy Ba","is_ca":true},{"name":"Sanja Fidler","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03155445305249521,"gpt":0.3241901345896976,"spread":0.2926356815372024,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008886644,0.0007510662,0.0007149902,0.0005093642,0.0002766699,0.0005849849,0.001191748,0.001106656,0.002560674],"category_scores_gemma":[0.003573085,0.0003750398,0.0004034023,0.0004310197,0.0008421114,0.001250592,0.0008722362,0.001443749,0.000490779],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008313048,"about_ca_system_score_gemma":0.001309435,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005436162,"about_ca_topic_score_gemma":0.00684453,"domain_scores_codex":[0.9997265,0.00008783876,0.00001291296,0.00006914877,0.00006718761,0.00003647517],"domain_scores_gemma":[0.9990047,0.0005756516,0.0001035785,0.0001210264,0.0001269472,0.00006810696],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004468929,0.00004654371,0.0003578648,0.0000351798,0.00002190349,0.0000345557,0.00001687485,0.9576289,0.0005887345,0.007076573,0.001427115,0.03272104],"study_design_scores_gemma":[0.000004507508,0.00001430572,0.00002174723,0.000002453028,0.000001588965,0.000004024357,0.000001229614,0.9956046,0.0002177937,0.003896583,0.0002294372,0.000001686151],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03274063,0.0003472783,0.9600867,0.0004818095,0.0001686792,0.00007158482,0.0001935592,0.002493299,0.003416448],"genre_scores_gemma":[0.7861734,0.0003007497,0.2080812,0.0004578753,0.00007610657,0.0002276962,0.0004892196,0.0002507826,0.003942954],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005436162,"threshold_uncertainty_score":0.010809,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2151416233","doi":"","title":"Fitted Q-iteration in continuous action-space MDPs","year":2007,"lang":"en","type":"article","venue":"HAL (Le Centre pour la Communication Scientifique Directe)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":149,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Action (physics); Q-learning; Bellman equation; Trajectory; Set (abstract data type); Mathematical optimization; Action selection; Markov decision process; State space; Computer science; State (computer science); Function (biology); Value (mathematics); Space (punctuation); Selection (genetic algorithm); Mathematics; Algorithm; Artificial intelligence; Markov process; Machine learning; Statistics","authors":[{"name":"András Antos","is_ca":false},{"name":"Csaba Szepesvári","is_ca":true},{"name":"Rémi Munos","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0137757595605324,"gpt":0.2404128600699891,"spread":0.2266371005094567,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004333836,0.0009971182,0.00179438,0.0005977907,0.0004997684,0.001271118,0.0019362,0.002194867,0.002204964],"category_scores_gemma":[0.01910344,0.0009082287,0.0008128828,0.0006962336,0.003256886,0.002201631,0.001577053,0.002137963,0.0003959892],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00172397,"about_ca_system_score_gemma":0.001668487,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004786164,"about_ca_topic_score_gemma":0.002517279,"domain_scores_codex":[0.9981568,0.000971316,0.00007051754,0.000276726,0.0003354791,0.0001890812],"domain_scores_gemma":[0.9884686,0.009002777,0.0007130791,0.000454944,0.0007976193,0.0005629124],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001174317,0.00003950673,0.0003652794,0.00004181952,0.00002432946,0.00005630873,0.00005120328,0.9681436,0.000325541,0.025433,0.0002027691,0.005199137],"study_design_scores_gemma":[0.00001679392,0.00003165851,0.00002793409,0.00000427714,0.000002481004,0.000006165576,0.000004523295,0.9901957,0.0001118599,0.009494732,0.0001004335,0.000003356919],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03745475,0.0002183296,0.9604027,0.0002049564,0.0000293085,0.00004992067,0.00003415233,0.0002189856,0.001386906],"genre_scores_gemma":[0.8110002,0.000216002,0.1851416,0.0001320173,0.00003987824,0.0002702385,0.0001226414,0.0001010972,0.002976307],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004786164,"threshold_uncertainty_score":0.02291983,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2955319481","doi":"10.1002/aic.16689","title":"Toward self‐driving processes: A deep reinforcement learning approach to control","year":2019,"lang":"en","type":"article","venue":"AIChE Journal","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":144,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Reinforcement learning; Self driving; Reinforcement; Self-control; Control (management); Computer science; Artificial intelligence; Engineering; Psychology; Social psychology; Transport engineering","authors":[{"name":"Steven Spielberg","is_ca":true},{"name":"Aditya Tulsyan","is_ca":true},{"name":"Nathan P. Lawrence","is_ca":true},{"name":"Philip D. Loewen","is_ca":true},{"name":"R. Bhushan Gopaluni","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01407432987377703,"gpt":0.2322518334943767,"spread":0.2181775036205997,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000731565,0.0004913674,0.0005017924,0.0002520024,0.0002458165,0.0005431129,0.0008532794,0.0007312971,0.001347165],"category_scores_gemma":[0.001522035,0.0002533119,0.0003192291,0.0002047978,0.0009241971,0.0005611267,0.0007718704,0.001238964,0.000131033],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008092059,"about_ca_system_score_gemma":0.0007485403,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005890329,"about_ca_topic_score_gemma":0.004054972,"domain_scores_codex":[0.9998074,0.00006686417,0.000008103092,0.00003369843,0.00005380239,0.00003018547],"domain_scores_gemma":[0.9994763,0.0002724335,0.00006976323,0.00004004003,0.000108743,0.00003271926],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0000119764,0.00001860102,0.000185559,0.00001511714,0.00001107465,0.00001649265,0.00001874131,0.9805617,0.0008845752,0.008834914,0.0001897331,0.00925148],"study_design_scores_gemma":[0.000001712991,0.000005428817,0.00001531612,9.659152e-7,8.788135e-7,0.0000012041,6.947328e-7,0.9983663,0.00007373533,0.001463133,0.00006990894,7.906e-7],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02387824,0.000200081,0.9720256,0.0003063627,0.00002852698,0.00002496858,0.0000138605,0.0001966041,0.003325677],"genre_scores_gemma":[0.9386797,0.0001581877,0.05854211,0.0001106962,0.0000326995,0.00006692056,0.00001926551,0.00002789685,0.002362489],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005890329,"threshold_uncertainty_score":0.01171213,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2738109916","doi":"10.1109/adconip.2017.7983780","title":"Deep reinforcement learning approaches for process control","year":2017,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":137,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Reinforcement learning; Computer science; Process (computing); Controller (irrigation); Artificial neural network; Process control; Control (management); Artificial intelligence; Control system; Control engineering; Function (biology); Deep learning; Control theory (sociology); MIMO; Engineering; Channel (broadcasting)","authors":[{"name":"Steven Spielberg","is_ca":true},{"name":"R. Bhushan Gopaluni","is_ca":true},{"name":"Philip D. Loewen","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04951332030694924,"gpt":0.2817894084133649,"spread":0.2322760881064156,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001138261,0.001001472,0.0009709423,0.0003857557,0.0002876362,0.0008051505,0.001116956,0.0009863629,0.002538676],"category_scores_gemma":[0.002345035,0.0004066324,0.000503989,0.0004007075,0.0009003193,0.0009605336,0.0009586475,0.00197003,0.0003379282],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001388746,"about_ca_system_score_gemma":0.001056402,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0065151,"about_ca_topic_score_gemma":0.004658295,"domain_scores_codex":[0.9996094,0.0001125576,0.0000238435,0.00007066301,0.0001243243,0.00005926828],"domain_scores_gemma":[0.999151,0.0004591598,0.00008982162,0.00006404134,0.0001947512,0.00004128551],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002413946,0.00002268369,0.0001816882,0.00005770325,0.00002412811,0.00002567956,0.00002136811,0.9565096,0.0006054741,0.01967433,0.0004285979,0.02242464],"study_design_scores_gemma":[0.00000417044,0.0000108583,0.00003122049,0.000005153555,0.00000274198,0.000003419219,0.000001855552,0.9905855,0.000190549,0.00874764,0.0004141695,0.000002651565],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005876937,0.0009916968,0.9895501,0.0003035294,0.00006160966,0.00002163032,0.0000322404,0.0002486222,0.002913633],"genre_scores_gemma":[0.8685772,0.001204969,0.1234967,0.0002414217,0.0001097067,0.0001578154,0.0001207776,0.00008725264,0.006004105],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0065151,"threshold_uncertainty_score":0.01295435,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2128812357","doi":"","title":"Error Propagation for Approximate Policy and Value Iteration","year":2010,"lang":"en","type":"preprint","venue":"PolyPublie (École Polytechnique de Montréal)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":135,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Value (mathematics); Computer science; Mathematical optimization; Algorithm; Mathematics; Machine learning","authors":[{"name":"Amir‐massoud Farahmand","is_ca":true},{"name":"Rémi Munos","is_ca":true},{"name":"Csaba Szepesvári","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01625520364976859,"gpt":0.2649227238120397,"spread":0.2486675201622711,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007904045,0.001498975,0.001764087,0.001214075,0.0007377123,0.002273334,0.002082408,0.002689722,0.004207565],"category_scores_gemma":[0.04348683,0.000785767,0.0007874119,0.001217607,0.003749675,0.003928559,0.003782235,0.004313414,0.0007254895],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003285028,"about_ca_system_score_gemma":0.00252594,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00515839,"about_ca_topic_score_gemma":0.00335247,"domain_scores_codex":[0.9957072,0.001702837,0.0001874487,0.0005658721,0.001428864,0.0004077978],"domain_scores_gemma":[0.9775557,0.01726518,0.001505102,0.001344682,0.001930745,0.000398596],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.000216248,0.00005781836,0.0006262692,0.0001431301,0.00005135576,0.0000601471,0.0001413998,0.7781641,0.001280987,0.1763267,0.001052212,0.04187969],"study_design_scores_gemma":[0.000007244047,0.00002177453,0.00003587197,0.00001198061,0.000003902634,0.000007196233,0.000004281988,0.9692652,0.0004684213,0.02993342,0.0002350444,0.00000567531],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.007718309,0.0002617565,0.9890178,0.0003311021,0.00004373981,0.00003156481,0.00002149304,0.0001838577,0.002390293],"genre_scores_gemma":[0.6406959,0.0005838335,0.3483793,0.0004550149,0.000150429,0.0003497949,0.0001540962,0.0003082992,0.008923279],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007904045,"threshold_uncertainty_score":0.04180104,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2804948070","doi":"","title":"Using Reward Machines for High-Level Task Specification and Decomposition in Reinforcement Learning","year":2018,"lang":"en","type":"article","venue":"International Conference on Machine Learning","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":129,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Reinforcement learning; Computer science; Task (project management); Decomposition; Artificial intelligence; Human–computer interaction; Engineering","authors":[{"name":"Rodrigo Toro Icarte","is_ca":true},{"name":"Toryn Q. Klassen","is_ca":true},{"name":"Richard Valenzano","is_ca":true},{"name":"Sheila A. McIlraith","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.09333430035172953,"gpt":0.3548435333796292,"spread":0.2615092330278997,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002548145,0.001008833,0.00138035,0.0004851958,0.0005417572,0.001418746,0.001537703,0.001567223,0.00428763],"category_scores_gemma":[0.009726472,0.0008914248,0.0008940281,0.000450998,0.001341304,0.002187766,0.002053584,0.003628187,0.0008703198],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001063457,"about_ca_system_score_gemma":0.001747118,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002853697,"about_ca_topic_score_gemma":0.004632657,"domain_scores_codex":[0.9986793,0.0005568902,0.00009434766,0.0002207119,0.0002696562,0.0001791415],"domain_scores_gemma":[0.995841,0.002909778,0.0002672012,0.0004107089,0.0003769085,0.0001944149],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000208343,0.0001549061,0.0006406398,0.0001236745,0.00004840447,0.00008591618,0.0001444381,0.8396086,0.005107183,0.03582956,0.001282078,0.1167662],"study_design_scores_gemma":[0.000008479065,0.00001578575,0.00003292048,0.000005340651,0.000003193726,0.000004263457,0.000003306382,0.987394,0.00072068,0.01164228,0.0001653805,0.000004351424],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.004756275,0.00004125893,0.9940925,0.00006205506,0.00001619092,0.00003077303,0.00001706711,0.0005299415,0.0004539775],"genre_scores_gemma":[0.5462818,0.00009231898,0.4505089,0.0001492713,0.0000331814,0.0003952037,0.0001223788,0.0002844098,0.002132419],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00428763,"threshold_uncertainty_score":0.01434356,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2071814471","doi":"10.1145/1102351.1102472","title":"Bayesian sparse sampling for on-line reward optimization","year":2005,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":122,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Computer science; Machine learning; Bayesian probability; Sampling (signal processing); Action selection; Artificial intelligence; Bayesian optimization; Thompson sampling; Selection (genetic algorithm); Bayesian inference; Mathematical optimization; Mathematics","authors":[{"name":"Tao Wang","is_ca":true},{"name":"Daniel J. Lizotte","is_ca":true},{"name":"Michael Bowling","is_ca":true},{"name":"Dale Schuurmans","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06390024574608347,"gpt":0.3090228942151267,"spread":0.2451226484690433,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002255764,0.0009223177,0.001644395,0.0007098412,0.0004746097,0.0009450305,0.00146517,0.00131731,0.003496309],"category_scores_gemma":[0.01244097,0.0007488164,0.0005442426,0.0008439115,0.001223319,0.001603749,0.001386503,0.002144269,0.0007544998],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00135506,"about_ca_system_score_gemma":0.001582255,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004599147,"about_ca_topic_score_gemma":0.005815434,"domain_scores_codex":[0.9984425,0.0007559828,0.00004584587,0.0001393258,0.000466181,0.0001502371],"domain_scores_gemma":[0.995276,0.003629533,0.000259422,0.0002724325,0.0004076521,0.0001548478],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001066579,0.00007068943,0.0003730438,0.00006610405,0.00002535379,0.00003549924,0.00004085288,0.9208956,0.0007691351,0.0339901,0.001533236,0.0420938],"study_design_scores_gemma":[0.000008057229,0.000008654721,0.00001993896,0.000003585806,0.000001767189,0.000003524868,0.000001376963,0.9900764,0.0001279549,0.009598591,0.0001484074,0.00000188478],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003945312,0.0001295823,0.9946301,0.0001174024,0.00001576587,0.00002922191,0.00002683472,0.00018899,0.000916827],"genre_scores_gemma":[0.5552104,0.0003945354,0.4399188,0.000301768,0.0001119003,0.0004578192,0.0002412844,0.0001829981,0.003180459],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004599147,"threshold_uncertainty_score":0.01192981,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2977481643","doi":"10.1609/aaai.v35i12.17276","title":"Improving Sample Efficiency in Model-Free Reinforcement Learning from Images","year":2021,"lang":"en","type":"preprint","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":121,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Robustness (evolution); Computer science; Artificial intelligence; Stability (learning theory); Machine learning; Encoder; Representation (politics); Noise (video); Code (set theory); Image (mathematics)","authors":[{"name":"Denis Yarats","is_ca":false},{"name":"Amy Zhang","is_ca":true},{"name":"Ilya Kostrikov","is_ca":false},{"name":"Brandon Amos","is_ca":false},{"name":"Joëlle Pineau","is_ca":true},{"name":"Rob Fergus","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.07127289501225326,"gpt":0.2836056152858242,"spread":0.2123327202735709,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003099155,0.001084658,0.001578146,0.000487317,0.0005415608,0.001027408,0.001959354,0.001416929,0.00241057],"category_scores_gemma":[0.01484934,0.0007995028,0.0005556846,0.0003333554,0.001785584,0.00218686,0.001945493,0.0022878,0.0004862301],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00124865,"about_ca_system_score_gemma":0.001641659,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004899444,"about_ca_topic_score_gemma":0.004968627,"domain_scores_codex":[0.9991339,0.0003630647,0.00004180688,0.0001845011,0.0001717569,0.0001050624],"domain_scores_gemma":[0.9942808,0.004170848,0.0003821589,0.00065927,0.0003222139,0.000184822],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002275586,0.0001296509,0.001024837,0.00008547858,0.00003937187,0.00007330465,0.000102177,0.9321941,0.002344172,0.01676286,0.0008702454,0.04614608],"study_design_scores_gemma":[0.00001313598,0.00002218607,0.00004434441,0.000004713864,0.000002714956,0.000006787918,0.000003214012,0.9947321,0.0004665226,0.004617885,0.00008383371,0.000002548156],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04095241,0.0001798439,0.9556742,0.0003145358,0.00002435989,0.00005164371,0.00003249415,0.001066449,0.001704109],"genre_scores_gemma":[0.8612784,0.00009830592,0.1359755,0.0002162296,0.00002824301,0.0001476574,0.0001081945,0.000244299,0.001903166],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004899444,"threshold_uncertainty_score":0.01639009,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W359568995","doi":"","title":"A convergent O ( n ) algorithm for off-policy temporal-difference learning with linear function approximation","year":2008,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":120,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Temporal difference learning; Markov decision process; Algorithm; Stochastic approximation; Function (biology); Reinforcement learning; Stochastic gradient descent; Markov process; Mathematics; Quadratic equation; Approximation algorithm; Norm (philosophy); Computer science; Function approximation; Mathematical optimization; Applied mathematics; Artificial intelligence; Statistics; Artificial neural network","authors":[{"name":"Richard S. Sutton","is_ca":true},{"name":"Csaba Szepesvári","is_ca":true},{"name":"Hamid Reza Maei","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02640782854945645,"gpt":0.2470170740798348,"spread":0.2206092455303784,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001867837,0.001108586,0.001220631,0.0006826366,0.0006233912,0.001051008,0.002579343,0.001722472,0.008051493],"category_scores_gemma":[0.008128007,0.000618944,0.0007617791,0.0006622829,0.001187645,0.001799745,0.002431361,0.003345339,0.003095479],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001715408,"about_ca_system_score_gemma":0.002252647,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004988086,"about_ca_topic_score_gemma":0.004152969,"domain_scores_codex":[0.9988976,0.0002188131,0.00007113923,0.0002796619,0.0004119797,0.0001208145],"domain_scores_gemma":[0.998046,0.001050529,0.000130837,0.0002318398,0.0004217121,0.0001189539],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003274444,0.0001960177,0.0007341583,0.0001585166,0.0000498368,0.0001263378,0.0001638461,0.4185304,0.00530529,0.0661085,0.006849732,0.5014498],"study_design_scores_gemma":[0.00002460053,0.00003043525,0.00003836428,0.000008624143,0.000003512223,0.00002738759,0.000006736061,0.9873511,0.0007685645,0.01048602,0.001248077,0.000006507244],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001509989,0.00009158822,0.9967186,0.000102977,0.00004331573,0.00004912211,0.00001559557,0.0004685019,0.001000389],"genre_scores_gemma":[0.1220626,0.0001411467,0.8715371,0.0003112572,0.00007819555,0.0004255668,0.0002074403,0.0002847689,0.004951846],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.008051493,"threshold_uncertainty_score":0.02693492,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2144794447","doi":"","title":"Bayes-Adaptive POMDPs","year":2007,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":112,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université Laval; McGill University","funders":"","keywords":"Partially observable Markov decision process; Reinforcement learning; Computer science; Markov decision process; Bellman equation; Artificial intelligence; Bayesian probability; Machine learning; Bayes' theorem; Markov process; Markov chain; Mathematical optimization; Markov model; Mathematics","authors":[{"name":"Stéphane Ross","is_ca":true},{"name":"Brahim Chaib-draa","is_ca":true},{"name":"Joëlle Pineau","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01648638832331079,"gpt":0.2496534226924639,"spread":0.2331670343691531,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002595408,0.001276553,0.001656006,0.0007084392,0.0007786297,0.001706403,0.002120264,0.001685219,0.005930243],"category_scores_gemma":[0.008723672,0.0008309413,0.001201151,0.0008219366,0.001886307,0.002486642,0.001751124,0.002677372,0.0007026959],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002106823,"about_ca_system_score_gemma":0.001830794,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008398677,"about_ca_topic_score_gemma":0.007056301,"domain_scores_codex":[0.9981615,0.0006448966,0.0001248097,0.0003837694,0.0004983515,0.0001866658],"domain_scores_gemma":[0.9967999,0.002214917,0.0003331369,0.0002000338,0.0003054329,0.0001465089],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0000698143,0.0000396915,0.0007856717,0.0001335031,0.00005144992,0.0001034609,0.0001207608,0.6881525,0.0003967959,0.2809283,0.001703215,0.02751478],"study_design_scores_gemma":[0.00002835617,0.0000151067,0.0000879245,0.00001571205,0.00001064695,0.00001879941,0.0000141343,0.8700805,0.0001220442,0.1276761,0.001920344,0.00001027521],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.00903169,0.0005928862,0.9813363,0.0005365959,0.00007873564,0.00009037509,0.0002337702,0.0002885201,0.007811164],"genre_scores_gemma":[0.6138174,0.001532952,0.3729467,0.0003263998,0.0001595786,0.0005983475,0.0006304537,0.0001091214,0.009879159],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008398677,"threshold_uncertainty_score":0.01983863,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2027648864","doi":"10.2991/agi.2010.22","title":"GQ( ): A general gradient algorithm for temporal-difference prediction learning with eligibility traces","year":2010,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":109,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Algorithm; Temporal difference learning; Artificial intelligence; Reinforcement learning","authors":[{"name":"Hamid Reza Maei","is_ca":true},{"name":"Richard S. Sutton","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01308984256616065,"gpt":0.2579115051959552,"spread":0.2448216626297946,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002528707,0.0009073819,0.001113972,0.0007093922,0.0003973754,0.001030508,0.002518483,0.001841132,0.005423053],"category_scores_gemma":[0.006968262,0.0005336033,0.0006177147,0.0007473155,0.0010506,0.002075286,0.002155966,0.002113338,0.001083969],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001133074,"about_ca_system_score_gemma":0.002120252,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006174657,"about_ca_topic_score_gemma":0.004676297,"domain_scores_codex":[0.9993852,0.0002094904,0.00004412916,0.0001325429,0.000159303,0.00006938798],"domain_scores_gemma":[0.9988129,0.0006701143,0.00008467666,0.0001163748,0.0002341908,0.00008171437],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002490602,0.0001443331,0.0009947249,0.0001789367,0.00007416377,0.00009073278,0.000134179,0.5094894,0.00242225,0.09726028,0.006282497,0.3826795],"study_design_scores_gemma":[0.00003217225,0.00003008253,0.00005238993,0.000008854149,0.000005418294,0.00001807645,0.000005313682,0.9791911,0.000436153,0.01904161,0.001172414,0.00000637876],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.002011071,0.00007381991,0.9966607,0.0001070157,0.00003303821,0.00004822846,0.00002681276,0.0004789899,0.0005603284],"genre_scores_gemma":[0.1549502,0.0001780422,0.8397954,0.0003457774,0.00006955458,0.0004276026,0.0002111724,0.0003973737,0.003624978],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.006174657,"threshold_uncertainty_score":0.01814187,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2158738729","doi":"","title":"Regularized Policy Iteration","year":2008,"lang":"en","type":"article","venue":"PolyPublie (École Polytechnique de Montréal)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":108,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University; University of Alberta","funders":"","keywords":"Reinforcement learning; Mathematical optimization; Regularization (linguistics); Reproducing kernel Hilbert space; Temporal difference learning; Computer science; Bellman equation; Markov decision process; Kernel (algebra); Residual; Hilbert space; Parametric statistics; Convergence (economics); Function approximation; Rate of convergence; Algorithm; Mathematics; Artificial intelligence; Markov process; Artificial neural network","authors":[{"name":"Amir massoud Farahmand","is_ca":true},{"name":"Mohammad Ghavamzadeh","is_ca":false},{"name":"Shie Mannor","is_ca":true},{"name":"Csaba Szepesvári","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01361379034717296,"gpt":0.2341841148069613,"spread":0.2205703244597883,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00190299,0.0008924506,0.001349678,0.0003692324,0.0003362269,0.001203269,0.001278156,0.001518259,0.003246419],"category_scores_gemma":[0.007979701,0.0004279292,0.0004833061,0.0003768031,0.001663432,0.001430638,0.001351804,0.001437764,0.0006724038],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001080038,"about_ca_system_score_gemma":0.001780607,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001994019,"about_ca_topic_score_gemma":0.001146782,"domain_scores_codex":[0.9987444,0.0005407333,0.00005282442,0.0002464064,0.0003060497,0.000109539],"domain_scores_gemma":[0.9970472,0.001862678,0.0002637508,0.0002751006,0.000442888,0.0001083672],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001006235,0.0000549424,0.0003513941,0.0001002468,0.00004240359,0.00005687468,0.00006817812,0.8846641,0.001187747,0.0785394,0.001001103,0.03383295],"study_design_scores_gemma":[0.000009769747,0.00002004354,0.00001784286,0.000005249155,0.000002668041,0.000009823469,0.000003211153,0.9895075,0.0003020564,0.009545557,0.0005728809,0.000003461987],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005806307,0.0001746568,0.9914238,0.000144066,0.00004951129,0.0000375534,0.00002070078,0.0001271745,0.00221619],"genre_scores_gemma":[0.6361047,0.0003598688,0.3534197,0.000308216,0.0001046043,0.0003865099,0.0001440059,0.0001506075,0.00902177],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003246419,"threshold_uncertainty_score":0.01086038,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1758031947","doi":"10.48550/arxiv.1206.3285","title":"Dyna-Style Planning with Linear Function Approximation and Prioritized Sweeping","year":2012,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":107,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Computer science; Bellman equation; Function (biology); Limit (mathematics); Mathematical optimization; Function approximation; State (computer science); Linear approximation; Linear programming; Artificial intelligence; Algorithm; Mathematics; Nonlinear system; Artificial neural network","authors":[{"name":"Richard S. Sutton","is_ca":true},{"name":"Csaba Szepesvári","is_ca":true},{"name":"Alborz Geramifard","is_ca":true},{"name":"Michael Bowling","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0529436338934253,"gpt":0.1830294782193934,"spread":0.1300858443259681,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001275479,0.0008478198,0.0009517409,0.0004985373,0.0004573659,0.0009585,0.001277655,0.001093393,0.003294965],"category_scores_gemma":[0.003862632,0.0006270082,0.0005747338,0.0006258675,0.001383964,0.001503889,0.001411386,0.00141293,0.0003768268],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001073436,"about_ca_system_score_gemma":0.001509038,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007459655,"about_ca_topic_score_gemma":0.006504701,"domain_scores_codex":[0.9993908,0.0002407641,0.00003178,0.0001282652,0.0001223654,0.00008589787],"domain_scores_gemma":[0.9983981,0.001109318,0.0001248587,0.000166153,0.0001111701,0.00009038184],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006698437,0.00003064029,0.0003396661,0.00003768453,0.00002131559,0.00004654857,0.00005983285,0.9609173,0.0006179055,0.01725781,0.000253055,0.0203512],"study_design_scores_gemma":[0.000008228252,0.00001646994,0.00002427571,0.000002626411,0.000002723134,0.000005666138,0.000004262212,0.9918371,0.0002131493,0.007690482,0.0001921632,0.00000278215],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03115027,0.0001692802,0.9649688,0.0002230426,0.00002496319,0.00004052421,0.00005501866,0.000677253,0.002690889],"genre_scores_gemma":[0.7979031,0.0001407247,0.1978676,0.0001108836,0.00002568199,0.0001491866,0.00009955,0.00009618563,0.003607178],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007459655,"threshold_uncertainty_score":0.01483244,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2593237273","doi":"10.1609/aaai.v32i1.11631","title":"Multi-Step Reinforcement Learning: A Unifying Algorithm","year":2018,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":107,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada; Alberta Innovates; DeepMind","keywords":"Reinforcement learning; Computer science; Backup; Algorithm; TRACE (psycholinguistics); Sampling (signal processing); Focus (optics); Monte Carlo method; Importance sampling; Artificial intelligence; Machine learning; Mathematics","authors":[{"name":"Kristopher De Asis","is_ca":true},{"name":"Juan Hernandez-Garcia","is_ca":true},{"name":"Gerhard Holland","is_ca":true},{"name":"Richard S. Sutton","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.09247718432083181,"gpt":0.3136361361909427,"spread":0.2211589518701109,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005125657,0.001089709,0.001682817,0.0008340065,0.0005870996,0.00134367,0.003349214,0.002242376,0.00213215],"category_scores_gemma":[0.0106976,0.0005913439,0.0007992157,0.0006536894,0.001699375,0.003062309,0.002902421,0.003134806,0.0006357672],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001275611,"about_ca_system_score_gemma":0.00221014,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00214132,"about_ca_topic_score_gemma":0.002010247,"domain_scores_codex":[0.997906,0.000637068,0.0001462688,0.0005927667,0.0005471883,0.0001706874],"domain_scores_gemma":[0.9962378,0.00226886,0.0002181543,0.000695585,0.0003746171,0.0002050132],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002277628,0.0002248632,0.001323109,0.0001220436,0.00007502508,0.00007056214,0.0002295248,0.6289505,0.003076306,0.1005753,0.001859557,0.2632655],"study_design_scores_gemma":[0.00002434869,0.00004901222,0.00003607898,0.000009986517,0.000006142607,0.00001603444,0.000004921979,0.9825962,0.0006418874,0.01595887,0.0006500112,0.000006582957],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.004356501,0.0001238667,0.9937963,0.0001732886,0.00002700765,0.00005120847,0.000009462159,0.0004982041,0.0009641481],"genre_scores_gemma":[0.264034,0.0002019632,0.7325341,0.0003017705,0.0000790517,0.0002646954,0.00006869081,0.0002173772,0.002298352],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005125657,"threshold_uncertainty_score":0.02710736,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}