{"meta":{"query_hash":"7549d71632e2","filters":{"venue":"European Workshop on Reinforcement Learning"},"cohort_total":1,"direct_labels_cover":0,"predictions_cover":1,"exported":1,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/7549d71632e2","api":"https://metacan.xera.ac/api/v1/cohort?venue=European+Workshop+on+Reinforcement+Learning"},"results":[{"id":"W2136723863","doi":"","title":"An Empirical Analysis of Off-policy Learning in Discrete MDPs","year":2012,"lang":"en","type":"article","venue":"European Workshop on Reinforcement Learning","topic":"Advanced Bandit Algorithms Research","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Computer science; Reinforcement learning; Dynamic programming; Variance (accounting); Sampling (signal processing); Population; Mathematical optimization; Monte Carlo method; Policy analysis; Artificial intelligence; Algorithm; Statistics; Mathematics; Economics","score_opus":0.10710063990214132,"score_gpt":0.45902569817125777,"score_spread":0.35192505826911646,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2136723863","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8413725,0.002146841,0.15015802,0.0016039048,0.000078376375,0.00019488567,0.0004879375,0.00028962127,0.003668006],"genre_scores_gemma":[0.98661685,0.0003115764,0.011997653,0.00007410561,0.000021493153,0.000093805385,0.0003558908,0.0000361062,0.0004924193],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9961015,0.002500788,0.00016503871,0.00036813616,0.000607675,0.00025686546],"domain_scores_gemma":[0.8200043,0.1644182,0.0050822166,0.005882434,0.0033793636,0.0012334244],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.015754698,0.0008845141,0.0012162519,0.001139401,0.0006288991,0.0009969634,0.0017471621,0.001598429,0.0022085526],"category_scores_gemma":[0.10932687,0.00043899572,0.00065302814,0.000979577,0.002007967,0.0032508685,0.0013081932,0.002991931,0.0001467476],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00038296345,0.00032754114,0.012259377,0.00017737856,0.00008875811,0.00007429843,0.00008956291,0.94886714,0.00034021086,0.01752843,0.0011545249,0.01870978],"study_design_scores_gemma":[0.000026479227,0.00013384326,0.0024930981,0.000033489676,0.000013324474,0.000030442838,0.000039681094,0.98876476,0.00038131452,0.007846,0.00022508178,0.000012432005],"about_ca_topic_score_codex":0.004121312,"about_ca_topic_score_gemma":0.0024582609,"teacher_disagreement_score":0.015754698,"about_ca_system_score_codex":0.0021194818,"about_ca_system_score_gemma":0.0012917516,"threshold_uncertainty_score":0.08331978},"labels":[],"label_agreement":null}]}