{"id":"W7134189229","doi":"10.1109/bigdata66926.2025.11402164","title":"Development and Evaluation of an Agentic RAG with Embedded LLM-as-a Judge for Heart Failure Management: A Pilot Study","year":2025,"lang":"","type":"article","venue":"","topic":"Multi-Agent Systems and Negotiation","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Vector Institute; University Health Network","funders":"","keywords":"Heart failure; Quality of life (healthcare); Heart disease; Disease","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005735405,0.0004477719,0.0005225365,0.0003669478,0.0007152774,0.001483217,0.002189113,0.001257273,0.008457382],"category_scores_gemma":[0.01312118,0.0003194328,0.0003382042,0.0002100787,0.0008226493,0.001159083,0.001280828,0.0011787,0.001759903],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006278869,"about_ca_system_score_gemma":0.001811988,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001427878,"about_ca_topic_score_gemma":0.001463596,"domain_scores_codex":[0.997841,0.001383691,0.0001204935,0.0001956717,0.0002948036,0.0001643963],"domain_scores_gemma":[0.9911334,0.004935555,0.0002979657,0.0007889165,0.001086946,0.001757117],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.02832607,0.1362778,0.04009757,0.00277264,0.000558749,0.003454973,0.01672775,0.04010411,0.07989436,0.0124258,0.01260646,0.6267538],"study_design_scores_gemma":[0.02598713,0.2932999,0.08465523,0.0007370471,0.001615072,0.002471673,0.01677442,0.359568,0.08293488,0.00679294,0.1244257,0.0007379455],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9603691,0.0001165798,0.02648503,0.0003415236,0.000125378,0.003994784,0.0001918983,0.001216532,0.007159236],"genre_scores_gemma":[0.9035233,0.0001435233,0.0856988,0.0003384909,0.00004361809,0.002149798,0.0004344213,0.0001589302,0.007509095],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.008457382,"threshold_uncertainty_score":0.03033215,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05866464637048359,"score_gpt":0.3280543039253997,"score_spread":0.2693896575549162,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}