{"id":"W7130594573","doi":"10.1109/icec2nt65402.2025.11380079","title":"Decoding Drift: Trustworthy Prompt Optimization in High-Stakes AI Environments","year":2025,"lang":"","type":"article","venue":"","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Occupational Cancer Research Centre","funders":"","keywords":"Interpretability; Trustworthiness; Reliability (semiconductor); Benchmark (surveying); Baseline (sea); Calibration; Reinforcement learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01813554,0.001394373,0.001105038,0.0008313626,0.0008529429,0.00332674,0.002173727,0.002102736,0.002632307],"category_scores_gemma":[0.1102389,0.0007627201,0.0007079378,0.0004929521,0.002758134,0.004700926,0.004865656,0.003922069,0.0008349132],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001757013,"about_ca_system_score_gemma":0.003892986,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001682383,"about_ca_topic_score_gemma":0.001742521,"domain_scores_codex":[0.9827479,0.01110903,0.0008703204,0.00221986,0.002466491,0.0005864056],"domain_scores_gemma":[0.9494969,0.03445801,0.003580257,0.007351722,0.004050794,0.001062205],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001412892,0.0006799627,0.01326746,0.0006540152,0.0001840785,0.0005672231,0.003690806,0.5536641,0.02534272,0.06173827,0.005221466,0.3335769],"study_design_scores_gemma":[0.00009588055,0.0003737998,0.0008843205,0.00007507106,0.00004267205,0.0001172924,0.0003666221,0.9049852,0.01255117,0.07713918,0.003308616,0.00006014063],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0496106,0.0001634545,0.9438775,0.0009400015,0.0000739126,0.0002437192,0.0001018999,0.003216017,0.001772888],"genre_scores_gemma":[0.7017757,0.0001032749,0.2954462,0.0004511284,0.00004911749,0.0002755601,0.0002203814,0.0004618588,0.001216871],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01813554,"threshold_uncertainty_score":0.09591103,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06735374649152064,"score_gpt":0.3906828405043595,"score_spread":0.3233290940128388,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}