{"id":"W3026736587","doi":"10.48550/arxiv.2005.11335","title":"Single-Agent Optimization Through Policy Iteration Using Monte-Carlo Tree Search","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Artificial Intelligence in Games","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Monte Carlo tree search; Computer science; Reinforcement learning; Normalization (sociology); Set (abstract data type); Search algorithm; Tree (set theory); Iterative deepening depth-first search; Monte Carlo method; Beam search; Mathematical optimization; Artificial intelligence; Algorithm; Best-first search; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0001646013,0.0003486885,0.000321352,0.000314992,0.0002536991,0.000463713,0.001706144,0.0002953638,0.00002747787],"category_scores_gemma":[0.0001055634,0.000431527,0.0002110441,0.001216163,0.000136081,0.001112869,0.002156259,0.000519501,0.00007333666],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007936244,"about_ca_system_score_gemma":0.000440748,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001199959,"about_ca_topic_score_gemma":0.00006311615,"domain_scores_codex":[0.997534,0.0002511092,0.0003311406,0.00125646,0.0002062006,0.0004211371],"domain_scores_gemma":[0.9981358,0.00008860983,0.0002558939,0.001025576,0.0003224572,0.0001716512],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0000169416,0.0000704247,0.0001964153,0.00003107894,0.00004027509,0.0001070811,0.002055837,0.9497086,0.0004153252,0.04592847,0.00005039302,0.001379204],"study_design_scores_gemma":[0.00008586152,0.00006404427,0.00002999381,0.00007597253,0.00003342305,0.000003613038,0.0001814298,0.9831944,0.002882201,0.01293622,0.0001312061,0.0003816539],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08703981,0.00003862744,0.9093158,0.0007154774,0.0005035875,0.000371483,0.000009154701,0.0002998545,0.001706181],"genre_scores_gemma":[0.9511148,0.00009293181,0.04789709,0.000225364,0.0003027173,7.614248e-7,0.00001227575,0.00002843353,0.0003256713],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8640749,"threshold_uncertainty_score":0.9998137,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2789313618876238,"score_gpt":0.2631439524162559,"score_spread":0.01578740947136786,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}