{"id":"W1999095902","doi":"10.1109/cig.2013.6633642","title":"Stacked calibration of off-policy policy evaluation for video game matchmaking","year":2013,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Ubisoft (Canada); Université de Montréal","funders":"","keywords":"Computer science; Function (biology); Calibration; Video game; Simple (philosophy); Statistics; Multimedia; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007801271,0.001973756,0.001880546,0.001086283,0.0006688668,0.001632772,0.002398074,0.002820081,0.002735267],"category_scores_gemma":[0.04405854,0.001211011,0.0006730965,0.0007591086,0.001405609,0.002704782,0.002039242,0.00399794,0.0009577582],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00211173,"about_ca_system_score_gemma":0.002463704,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008292704,"about_ca_topic_score_gemma":0.006647896,"domain_scores_codex":[0.9970495,0.001194273,0.0001605651,0.0007483484,0.0005046161,0.0003426571],"domain_scores_gemma":[0.9870771,0.007958332,0.001223679,0.001725914,0.001511343,0.0005037163],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002899613,0.0002931186,0.003380131,0.00008090767,0.0001053077,0.00005084766,0.00009472878,0.9086015,0.002928053,0.002780608,0.001002788,0.08039209],"study_design_scores_gemma":[0.00001184072,0.00006899599,0.0005970519,0.00001247247,0.000008279768,0.00001390261,0.00001091994,0.9954906,0.001542663,0.002024387,0.000204328,0.00001463257],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1139719,0.0006371039,0.8777419,0.0004694258,0.0001439909,0.0002111187,0.0001698815,0.003316715,0.003337802],"genre_scores_gemma":[0.9028541,0.0001317449,0.09472997,0.0002413657,0.00004560751,0.000171881,0.0002951185,0.0001910048,0.001339175],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008292704,"threshold_uncertainty_score":0.0412575,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03258298194827107,"score_gpt":0.321816013989087,"score_spread":0.289233032040816,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}