{"id":"W7134189229","doi":"10.1109/bigdata66926.2025.11402164","title":"Development and Evaluation of an Agentic RAG with Embedded LLM-as-a Judge for Heart Failure Management: A Pilot Study","year":2025,"lang":"","type":"article","venue":"","topic":"Multi-Agent Systems and Negotiation","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Vector Institute; University Health Network","funders":"","keywords":"Heart failure; Quality of life (healthcare); Heart disease; Disease","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.003297662,0.0003221722,0.0004334748,0.0004108096,0.0003863851,0.0003160554,0.0003954599,0.00005225244,0.0000675684],"category_scores_gemma":[0.00002442568,0.0002757082,0.00003943784,0.0006654355,0.00003987848,0.0006371746,0.0002416142,0.00007387001,0.00001125401],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001391413,"about_ca_system_score_gemma":0.0003700993,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001019344,"about_ca_topic_score_gemma":0.0009213202,"domain_scores_codex":[0.9963729,0.000396109,0.0008345045,0.000963256,0.001079951,0.0003532475],"domain_scores_gemma":[0.9982186,0.00006215813,0.0002981103,0.000715978,0.0005859876,0.000119176],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003330327,0.05246076,0.03057608,0.01112438,0.008130703,0.00003502616,0.145366,0.00614967,0.009132436,0.1125467,0.005836818,0.6153112],"study_design_scores_gemma":[0.02164814,0.009173648,0.1831053,0.0008849151,0.001206341,0.000009196909,0.01431443,0.7562083,0.009240478,0.0005298355,0.002777157,0.0009022442],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8204381,0.00009563509,0.1709145,0.0002736549,0.000340447,0.00714716,0.000001802636,0.00004410983,0.000744476],"genre_scores_gemma":[0.9396265,0.000003029286,0.05807401,0.0001377188,0.00002167706,0.0005053091,0.00001008717,0.00001377587,0.001607907],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7500587,"threshold_uncertainty_score":0.9999695,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05866464637048359,"score_gpt":0.3280543039253997,"score_spread":0.2693896575549162,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}