{"id":"W3037660226","doi":"10.65109/yiph3635","title":"Maximizing Information Gain in Partially Observable Environments via Prediction Rewards","year":2020,"lang":"en","type":"article","venue":"","topic":"Domain Adaptation and Few-Shot Learning","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"European Commission","keywords":"MNIST database; Computer science; Reinforcement learning; Artificial intelligence; Action selection; Inference; Entropy (arrow of time); Function (biology); Realizability; Machine learning; Deep learning; Perception; Algorithm","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002556988,0.00007789607,0.00008218201,0.00005625356,0.00006190702,0.0001276908,0.0002535952,0.00004276569,0.00007126764],"category_scores_gemma":[0.00007269014,0.00007939852,0.00002468291,0.0002724778,0.00001043315,0.002033883,0.0001068353,0.0001180017,0.0003347628],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004970194,"about_ca_system_score_gemma":0.00002566665,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002405118,"about_ca_topic_score_gemma":0.000006093685,"domain_scores_codex":[0.9990702,0.00005648312,0.0002785976,0.0001585573,0.0002597892,0.0001764115],"domain_scores_gemma":[0.9996499,0.00002004253,0.00007335262,0.000146985,0.00001317397,0.00009653426],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009791736,0.0001488449,0.03717377,0.0000788339,0.00003770272,0.00002832305,0.03194403,0.4170687,0.01369192,0.03354011,0.005062093,0.4611278],"study_design_scores_gemma":[0.0004259102,0.00005426957,0.01635307,0.000006564647,0.000001200474,0.000001431537,0.0001730927,0.9344012,0.0007263814,0.0002447273,0.04752124,0.00009092625],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003465441,0.000008282603,0.986418,0.002444398,0.0001064128,0.0001214118,6.027194e-7,0.0001459421,0.007289478],"genre_scores_gemma":[0.9337495,0.00001528969,0.05976466,0.006194801,0.00003525791,0.00001553182,0.00001630503,0.000005162015,0.0002034852],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9302841,"threshold_uncertainty_score":0.4302811,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02620721636987957,"score_gpt":0.2058696704913703,"score_spread":0.1796624541214907,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}