{"id":"W2965415665","doi":"10.24963/ijcai.2019/532","title":"Learning Multi-Objective Rewards and User Utility Function in Contextual Bandits for Personalized Ranking","year":2019,"lang":"en","type":"article","venue":"","topic":"Advanced Bandit Algorithms Research","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"National University of Singapore","keywords":"Computer science; Ranking (information retrieval); Weighting; Context (archaeology); Function (biology); Machine learning; Artificial intelligence; Learning to rank","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003375284,0.001773513,0.002489121,0.0009595745,0.0006110654,0.00141452,0.001422027,0.001810055,0.002571532],"category_scores_gemma":[0.01313327,0.0007167257,0.000621894,0.001044482,0.001230293,0.002691504,0.001256248,0.002220121,0.00056504],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001560212,"about_ca_system_score_gemma":0.001282749,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005053562,"about_ca_topic_score_gemma":0.005707084,"domain_scores_codex":[0.9981253,0.001013812,0.0000826243,0.0003128136,0.0002609513,0.0002046214],"domain_scores_gemma":[0.9940977,0.004622275,0.0004694199,0.0002611635,0.0003255289,0.0002238836],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002443747,0.0001862137,0.001451785,0.0001119116,0.0000681793,0.00005487543,0.00008107217,0.9390056,0.0005315124,0.0136492,0.0008364955,0.04377878],"study_design_scores_gemma":[0.00001411233,0.00004747851,0.0001157362,0.0000112596,0.000009087021,0.000009030238,0.000007548011,0.9924406,0.0001752481,0.007030125,0.000133819,0.000005871595],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.08132121,0.001494074,0.913052,0.0005710614,0.00004937731,0.0001088434,0.0001360529,0.0006536732,0.002613657],"genre_scores_gemma":[0.8955204,0.0004551159,0.1006409,0.0002512464,0.00007482566,0.0002292036,0.0002048647,0.0001077819,0.002515676],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005053562,"threshold_uncertainty_score":0.0178504,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1100089455721881,"score_gpt":0.4211775392848835,"score_spread":0.3111685937126954,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}