{"id":"W6893539337","doi":"10.5281/zenodo.16875904","title":"Agentic and Non-Agentic Multi-Hop Systems for Medical Question Answering","year":2025,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"","keywords":"Task (project management); Pipeline (software); Question answering; Questions and answers; Joint (building); Semantics (computer science); Interrogative word","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0008210544,0.0001887121,0.0002288887,0.0003896281,0.0006411642,0.001001106,0.001442292,0.0001882392,0.001294007],"category_scores_gemma":[0.0006260026,0.0002021074,0.00004754719,0.0002756215,0.00007085058,0.000140216,0.001509928,0.0002406865,0.0007088449],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00009453601,"about_ca_system_score_gemma":0.00001469992,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008325254,"about_ca_topic_score_gemma":0.000001425426,"domain_scores_codex":[0.9981067,0.0002065109,0.0002792899,0.0006455698,0.0004319441,0.0003300126],"domain_scores_gemma":[0.9988151,0.00002986612,0.000131616,0.0006093963,0.000224793,0.0001892745],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00001330269,0.0001456444,0.000003421114,0.002017172,0.0001642641,0.00004853571,0.0008596375,0.0001832275,0.000224259,0.02675477,0.7940031,0.1755826],"study_design_scores_gemma":[0.0004663756,0.00004819059,0.0000197118,0.0004910888,0.0000162031,0.00003310523,0.00002839239,0.1656864,0.000009684461,0.0000467449,0.8329687,0.0001854277],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"methods","genre_gemma":"other","genre_scores_codex":[0.00003323853,0.0006990708,0.9190186,0.0002788719,0.0005552206,0.0007690676,0.00005080586,0.001033925,0.07756122],"genre_scores_gemma":[0.06656014,0.00313387,0.05360555,0.0006342519,0.002109409,0.000002000381,0.001960645,0.01424804,0.8577461],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.865413,"threshold_uncertainty_score":0.9996189,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03086425441502821,"score_gpt":0.2675632992729495,"score_spread":0.2366990448579213,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}