{"id":"W4388623348","doi":"10.1109/ro-man57019.2023.10309622","title":"Adapting a Teachable Robot’s Dialog Responses using Reinforcement Learning in Teaching Conversation","year":2023,"lang":"en","type":"article","venue":"","topic":"Social Robot Interaction and HRI","field":"Psychology","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"Australian Research Council","keywords":"Reinforcement learning; Conversation; Dialog box; Computer science; Robot; Human–computer interaction; Selection (genetic algorithm); Task (project management); Artificial intelligence; Gaze; Gesture; Robotics; Social cue; Psychology; Engineering; World Wide Web; Cognitive psychology; Communication","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.001057234,0.0001005657,0.0001406759,0.0003511536,0.0002230705,0.00004479823,0.00007091933,0.00009171788,0.001624037],"category_scores_gemma":[0.0005110663,0.000107744,0.00005318306,0.0002614254,0.00001874756,0.0001638652,0.00004640505,0.0004311712,0.0007417668],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000174928,"about_ca_system_score_gemma":0.00003616776,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004584157,"about_ca_topic_score_gemma":0.0001540385,"domain_scores_codex":[0.9986502,0.0003826057,0.0002929622,0.0002171256,0.000141417,0.0003157188],"domain_scores_gemma":[0.9993008,0.0004170364,0.0001076775,0.0001120629,0.00002326022,0.00003913371],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001314264,0.000223665,0.2010624,0.00004155413,0.0002408052,0.000202338,0.2252073,0.3859977,0.03535752,0.07457706,0.01167473,0.06410076],"study_design_scores_gemma":[0.005215337,0.0005055472,0.138539,0.0003155068,0.0000658415,0.0000526595,0.2371753,0.5460995,0.0007614988,0.001034439,0.06896548,0.001269825],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7755368,0.00002199989,0.01953578,0.001269973,0.001812357,0.000334344,4.042307e-7,0.0007579498,0.2007304],"genre_scores_gemma":[0.961,0.000002608454,0.0004625667,0.0003999767,0.0001387358,0.00002057364,0.000009934331,0.00001964891,0.03794599],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1854632,"threshold_uncertainty_score":0.9992886,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.125742803229994,"score_gpt":0.4148619474141664,"score_spread":0.2891191441841724,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}