{"id":"W4416036138","doi":"10.18653/v1/2025.emnlp-main.1075","title":"Improving Context Fidelity via Native Retrieval-Augmented Reasoning","year":2025,"lang":"","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Alliance de recherche numérique du Canada","keywords":"Context (archaeology); Natural language; Fidelity; Natural (archaeology); Natural language understanding","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001879639,0.0005018189,0.0006165212,0.0003328821,0.0006576084,0.0006716525,0.001679188,0.0002938384,0.0003180093],"category_scores_gemma":[0.001342266,0.0005128434,0.0002489348,0.001586136,0.0001650272,0.001093116,0.001881063,0.0007646425,0.0000816025],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006391458,"about_ca_system_score_gemma":0.0008776297,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002160461,"about_ca_topic_score_gemma":0.0001133748,"domain_scores_codex":[0.9950584,0.0003802979,0.001239641,0.001683208,0.0006957437,0.0009426957],"domain_scores_gemma":[0.9964111,0.0004541778,0.0004181883,0.001650301,0.0008322654,0.0002339858],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009446046,0.0001279185,0.0005658864,0.0001523209,0.0001739234,0.0000257196,0.001831994,0.000388389,0.002884099,0.1209382,0.000699999,0.8721171],"study_design_scores_gemma":[0.001087182,0.00007661798,0.0006561109,0.0004371148,0.00004899157,0.00000625645,0.000472219,0.9755884,0.0160335,0.003962417,0.001168182,0.0004630074],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0146628,0.001828795,0.9540462,0.002474453,0.002901433,0.0006947091,0.000004430643,0.0003243148,0.02306278],"genre_scores_gemma":[0.9390484,0.00003591878,0.04355486,0.002828524,0.0001335688,0.000009812758,0.000002176753,0.00001685177,0.01436986],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9752,"threshold_uncertainty_score":0.9997323,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01701550256221682,"score_gpt":0.2702245270101477,"score_spread":0.2532090244479308,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}