{"id":"W2054795804","doi":"10.1109/icmla.2012.31","title":"An Inverse Reinforcement Learning Algorithm for Partially Observable Domains with Application on Healthcare Dialogue Management","year":2012,"lang":"en","type":"article","venue":"","topic":"Speech and dialogue systems","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université Laval","funders":"McGill University","keywords":"Partially observable Markov decision process; Markov decision process; Computer science; Reinforcement learning; Margin (machine learning); Artificial intelligence; Observable; Machine learning; Inverse; Markov process; Markov chain; Mathematical optimization; Markov model; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001960406,0.0007874116,0.001190161,0.0005563481,0.0005539649,0.0008212747,0.001293124,0.001212491,0.002564684],"category_scores_gemma":[0.00580862,0.00043077,0.0005630345,0.0003747633,0.00102896,0.001253813,0.001373232,0.00172195,0.0004076384],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001135887,"about_ca_system_score_gemma":0.00183638,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00478437,"about_ca_topic_score_gemma":0.002895381,"domain_scores_codex":[0.9991629,0.0003425144,0.00004273209,0.0001949479,0.0001800121,0.00007689172],"domain_scores_gemma":[0.9980043,0.001422914,0.0001534024,0.00009370428,0.0002377392,0.00008811858],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000110331,0.00009379558,0.0007644765,0.00007848089,0.00003558422,0.00008006344,0.0001582187,0.8600605,0.001057892,0.01881024,0.0009801555,0.1177703],"study_design_scores_gemma":[0.00001355295,0.00001621461,0.0000293248,0.000004312154,0.000002414684,0.000009984085,0.000005004558,0.9959207,0.0002217475,0.003485241,0.0002878657,0.000003589153],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005738731,0.00008761571,0.9928759,0.0001285977,0.00001764938,0.00004170707,0.00001467067,0.0003946249,0.0007004989],"genre_scores_gemma":[0.3952362,0.0001280211,0.6020771,0.0001653864,0.00003224294,0.0002867761,0.0001054401,0.0001227363,0.001846082],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00478437,"threshold_uncertainty_score":0.01036775,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02451411383205607,"score_gpt":0.2634534985663381,"score_spread":0.238939384734282,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}