{"id":"W4408767489","doi":"10.32388/ig5abm","title":"Review of: \"MTRAG: A Multi-Turn Conversational Benchmark for Evaluating Retrieval-Augmented Generation Systems\"","year":2025,"lang":"en","type":"peer-review","venue":"","topic":"Power Systems and Technologies","field":"Engineering","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Benchmark (surveying); Computer science; Turn-taking; Information retrieval; Turn (biochemistry); Artificial intelligence; Communication; Geography; Psychology; Conversation; Biology; Cartography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02219212,0.001106336,0.00151504,0.004787757,0.002125655,0.005908567,0.003702392,0.003113279,0.03100484],"category_scores_gemma":[0.1342168,0.0004280846,0.0008235046,0.003260999,0.001429882,0.004771317,0.003289648,0.002121583,0.02915395],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001963122,"about_ca_system_score_gemma":0.009758667,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01030818,"about_ca_topic_score_gemma":0.02268132,"domain_scores_codex":[0.9842159,0.005170249,0.0009238029,0.0008455677,0.008394091,0.0004503935],"domain_scores_gemma":[0.8494385,0.0428896,0.002665616,0.005057021,0.0953288,0.004620436],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001912006,0.00007163161,0.0004633403,0.00120902,0.00008013773,0.0000486116,0.000160965,0.000599205,0.00089248,0.001355218,0.8452448,0.1496836],"study_design_scores_gemma":[0.0001482499,0.0002739826,0.003552955,0.00175638,0.0002137037,0.0001186631,0.0004098326,0.00440166,0.003388234,0.00239389,0.9832168,0.0001256181],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"commentary","genre_gemma":"commentary","genre_scores_codex":[0.03077368,0.1281904,0.1195338,0.2950745,0.1112752,0.005013474,0.05041087,0.02304819,0.23668],"genre_scores_gemma":[0.2005463,0.08149772,0.1051294,0.07577679,0.0384892,0.005468921,0.1262371,0.009259264,0.3575954],"genre_candidate":"commentary","genre_consensus":"commentary","teacher_disagreement_score":0.03100484,"threshold_uncertainty_score":0.1173645,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08660005250844185,"score_gpt":0.3502156399937281,"score_spread":0.2636155874852862,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}