{"id":"W7124181186","doi":"10.65109/apft3995","title":"Expectation-Maximization for Inverse Reinforcement Learning with Hidden Data","year":2016,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Missing data; Reinforcement learning; Task (project management); Trajectory; Feature (linguistics); Key (lock); State space; State (computer science); Sorting","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003364073,0.001414495,0.001932697,0.0004436492,0.0003535965,0.001042242,0.001940597,0.00159506,0.002178978],"category_scores_gemma":[0.01085268,0.0006163744,0.0007789339,0.0006387633,0.001856318,0.001345842,0.001642806,0.002657,0.0005572389],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00135577,"about_ca_system_score_gemma":0.00164406,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003427655,"about_ca_topic_score_gemma":0.002770713,"domain_scores_codex":[0.9987482,0.0006299778,0.00006638619,0.0002239302,0.0002186573,0.0001127569],"domain_scores_gemma":[0.9953058,0.003731777,0.0002659672,0.0001972364,0.000352435,0.0001466962],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00008628339,0.00006658535,0.0003637579,0.00009954531,0.0000569883,0.00007875861,0.00006576426,0.9523689,0.0005753265,0.01951398,0.0008104802,0.02591368],"study_design_scores_gemma":[0.000009709158,0.00001666843,0.0000213423,0.000004830267,0.000003504512,0.000005875707,0.000002937527,0.9898017,0.0001887784,0.009764059,0.0001772861,0.000003361003],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.004075622,0.0001791281,0.9946352,0.0001864613,0.00002272472,0.00002396755,0.00001777687,0.0001733594,0.000685689],"genre_scores_gemma":[0.6102374,0.0004026335,0.3847301,0.0003545406,0.0001029164,0.000407977,0.0001899344,0.0001935609,0.003380939],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.003427655,"threshold_uncertainty_score":0.01779109,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04984481620274459,"score_gpt":0.2751606179449554,"score_spread":0.2253158017422109,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}