{"id":"W3014454071","doi":"10.48550/arxiv.2004.00993","title":"Augmented Q Imitation Learning (AQIL)","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University","funders":"","keywords":"Reinforcement learning; Imitation; Artificial intelligence; Q-learning; Computer science; Process (computing); Convergence (economics); Machine learning; Unsupervised learning; Reinforcement; Learning classifier system; Sequence learning; Psychology; Social psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00181691,0.001040877,0.001398052,0.0004262692,0.0004124671,0.0009790116,0.002086709,0.001409556,0.004250956],"category_scores_gemma":[0.006899756,0.0004593043,0.0005324419,0.0005453159,0.001817353,0.001500791,0.002162426,0.001836678,0.0009284834],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007983019,"about_ca_system_score_gemma":0.001478824,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002758517,"about_ca_topic_score_gemma":0.002087445,"domain_scores_codex":[0.9990238,0.0003901314,0.00005563904,0.0001862601,0.0002429949,0.0001012291],"domain_scores_gemma":[0.9970632,0.001718175,0.0002439316,0.0003285531,0.0005014105,0.0001446305],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002306464,0.000189844,0.00117519,0.0004164792,0.0001173366,0.0002002066,0.0001760209,0.6760323,0.003635688,0.1058745,0.005429505,0.2065222],"study_design_scores_gemma":[0.00002558467,0.0000871108,0.00008474667,0.00001472718,0.00001036564,0.00003315526,0.000005201844,0.9735622,0.0005980404,0.02355738,0.002011661,0.000009832402],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.006828913,0.0006822251,0.9869121,0.0002744794,0.0001207192,0.00005822103,0.00003852376,0.0005535597,0.004531218],"genre_scores_gemma":[0.7770846,0.001028798,0.2094861,0.0005678376,0.0001910464,0.0003995378,0.0001706077,0.0001985138,0.01087299],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004250956,"threshold_uncertainty_score":0.01422083,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1046833920474487,"score_gpt":0.1914710324459511,"score_spread":0.08678764039850238,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}