{"id":"W3091315598","doi":"10.1109/ijcnn48605.2020.9207289","title":"Transformer Decoder Based Reinforcement Learning Approach for Conversational Response Generation","year":2020,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Transformer; Conversation; Reinforcement learning; Artificial intelligence; Language model; Speech recognition; Natural language processing; Machine learning; Voltage; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003281339,0.00006585921,0.00006440961,0.00003055327,0.00009767719,0.00006544763,0.0001767296,0.00003152021,0.00005796409],"category_scores_gemma":[0.00005852661,0.00006116087,0.00004526642,0.00007962435,0.000006876718,0.0002393297,0.00001207074,0.00005444704,0.000007260896],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002807616,"about_ca_system_score_gemma":0.000105393,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000002892328,"about_ca_topic_score_gemma":3.849792e-7,"domain_scores_codex":[0.9992562,0.00004532943,0.0001586576,0.0002403981,0.0001757941,0.0001235995],"domain_scores_gemma":[0.9996814,0.0000641752,0.0000285774,0.0001043531,0.00005729727,0.00006421418],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007672334,0.000006899952,0.00003148119,0.00001079612,0.000006330037,1.942921e-7,0.0008375807,0.9719047,0.00654698,0.01707867,0.0005521646,0.002947464],"study_design_scores_gemma":[0.0005787276,0.00007996846,0.00001472512,8.014845e-7,0.000002505049,3.469901e-7,0.00002372205,0.985697,0.008095741,0.00002527234,0.005399364,0.000081809],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.00246149,0.000004790112,0.9904414,0.005504296,0.00004451795,0.0002511416,3.159068e-7,0.00009962991,0.001192358],"genre_scores_gemma":[0.5967732,2.580893e-7,0.4004434,0.002379854,0.00005503212,0.00003123688,0.00001541942,0.000003317055,0.0002982728],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.5943117,"threshold_uncertainty_score":0.2494068,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06948471122514176,"score_gpt":0.2595321422884425,"score_spread":0.1900474310633007,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}