{"id":"W4287891193","doi":"10.18653/v1/2022.wordplay-1.4","title":"A Sequence Modelling Approach to Question Answering in Text-Based Games","year":2022,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Institut National de la Recherche Scientifique","funders":"","keywords":"Question answering; Computer science; Transformer; Reinforcement learning; Artificial intelligence; Machine learning; Benchmark (surveying); Language model; Task (project management); Natural language processing","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001129336,0.000785337,0.0006584872,0.0008125303,0.0004587021,0.0009456998,0.002068646,0.001462686,0.006046673],"category_scores_gemma":[0.004723603,0.0004663901,0.001190273,0.0005503015,0.001189531,0.001850942,0.001143962,0.001815551,0.00088811],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00148011,"about_ca_system_score_gemma":0.001239521,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01023053,"about_ca_topic_score_gemma":0.009912958,"domain_scores_codex":[0.9991865,0.0004063124,0.00003946169,0.000184401,0.0001230357,0.00006039473],"domain_scores_gemma":[0.998572,0.001038273,0.00008480954,0.00008920351,0.0001260484,0.00008964774],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0001563328,0.0002015373,0.0008265752,0.0001833774,0.00006537414,0.000181024,0.0005995299,0.7379671,0.005339856,0.1891775,0.002210105,0.06309175],"study_design_scores_gemma":[0.000009281012,0.00003075662,0.00005922107,0.000004538804,0.000004754802,0.00001462281,0.00001199786,0.9648967,0.0003787323,0.03378242,0.0008018279,0.00000513047],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.006837487,0.0001139131,0.9893488,0.0003374022,0.00003152278,0.0001026865,0.0001020983,0.0003575327,0.002768588],"genre_scores_gemma":[0.6581198,0.0003666663,0.3257047,0.0003763435,0.0001184969,0.0005742705,0.0004875237,0.0001575162,0.01409476],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01023053,"threshold_uncertainty_score":0.02034199,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03687691377713465,"score_gpt":0.2905471630438144,"score_spread":0.2536702492666797,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}