{"id":"W7131129852","doi":"10.1109/iccvw69036.2025.00142","title":"Prompt4Trust: A Reinforcement Learning Prompt Augmentation Framework for Clinically-Aligned Confidence Calibration in Multimodal Large Language Models","year":2025,"lang":"","type":"article","venue":"","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Mila - Quebec Artificial Intelligence Institute","funders":"Canada First Research Excellence Fund; Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Calibration; Task (project management); Reinforcement learning; Generalization; Key (lock); Codebase; Scalability; Sensitivity (control systems)","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.003708046,0.0005351063,0.0007288177,0.0005154103,0.0006246965,0.0006415786,0.001147718,0.0006383244,0.0002484633],"category_scores_gemma":[0.002641323,0.0005671136,0.0002212377,0.001264923,0.0000899952,0.001425308,0.0006592787,0.001167536,0.00002017862],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004480117,"about_ca_system_score_gemma":0.001103218,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001593862,"about_ca_topic_score_gemma":0.0003279653,"domain_scores_codex":[0.9930326,0.001026209,0.002387258,0.001588368,0.0007702803,0.001195319],"domain_scores_gemma":[0.9957438,0.001811267,0.0008322141,0.0009808263,0.0004002346,0.0002316999],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000384695,0.0002614712,0.007929997,0.001098869,0.00004766853,0.00001156531,0.02056591,0.3649054,0.0001099713,0.5833353,0.00006788527,0.02128129],"study_design_scores_gemma":[0.002583371,0.0007936856,0.001000151,0.001373197,0.00002952794,0.000001744198,0.002063494,0.9613845,0.0003891832,0.02979066,0.00009481207,0.0004957078],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01578851,0.0002544151,0.9700409,0.006279192,0.0009881963,0.005345148,0.000008050108,0.0003229911,0.0009726073],"genre_scores_gemma":[0.8155312,0.00004109649,0.1783903,0.001836246,0.0001270283,0.0007592415,0.00008289844,0.00003283897,0.003199109],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.7997427,"threshold_uncertainty_score":0.999678,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02777528130868037,"score_gpt":0.381475785817288,"score_spread":0.3537005045086077,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}