{"id":"W3034806614","doi":"","title":"ConQUR: Mitigating Delusional Bias in Deep Q-Learning","year":2020,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Domain Adaptation and Few-Shot Learning","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Google (Canada); University of Alberta","funders":"","keywords":"Computer science; Class (philosophy); Variety (cybernetics); Scheme (mathematics); Delusion; Q-learning; Artificial intelligence; Simple (philosophy); Value (mathematics); Machine learning; Reinforcement learning; Mathematics; Psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002159242,0.0001155568,0.0001332547,0.0001102265,0.0001747367,0.00007257232,0.0005370618,0.00005525282,0.00009733148],"category_scores_gemma":[0.0002138783,0.0001386095,0.00006121858,0.0009751383,0.00004879626,0.0005008983,0.0002880689,0.0003309562,0.0002224347],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00005263521,"about_ca_system_score_gemma":0.00005194276,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002769823,"about_ca_topic_score_gemma":0.00001870507,"domain_scores_codex":[0.9988766,0.0001743451,0.0001458644,0.0004586011,0.00008954157,0.0002550597],"domain_scores_gemma":[0.9993088,0.0001971858,0.0001003087,0.0001518413,0.00005406723,0.0001877738],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002771695,0.00003807278,0.05984583,0.00001620182,0.0000170129,0.0006143455,0.003892928,0.5584907,0.0006637795,0.3678518,0.00005775825,0.008483871],"study_design_scores_gemma":[0.0006034516,0.0000478645,0.006366914,0.00001587162,0.000003310154,0.000003536496,0.0007611643,0.9879732,0.00006248921,0.001277936,0.00270843,0.0001758948],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3794773,0.00002493989,0.6135478,0.0004303341,0.00006538449,0.00006426869,2.845784e-7,0.0001867826,0.006202902],"genre_scores_gemma":[0.9941828,0.00001353012,0.004581376,0.0009064244,0.00003149619,1.915551e-7,0.000002747815,0.000007958024,0.0002734508],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.6147056,"threshold_uncertainty_score":0.5652331,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1088076188527771,"score_gpt":0.1888258779277586,"score_spread":0.08001825907498143,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}