{"id":"W7082282613","doi":"10.48448/zr7a-0a35","title":"SafeRoute: Adaptive Model Selection for Efficient and Accurate Safety Guardrails in Large Language Models","year":2025,"lang":"en","type":"other","venue":"Underline Science Inc.","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Kootenay Association for Science & Technology","funders":"","keywords":"Guard (computer science); Router; Benchmark (surveying); Block (permutation group theory); Heuristics; Model selection; Selection (genetic algorithm)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003475652,0.002955259,0.001861314,0.001289139,0.0007720778,0.001867435,0.00361348,0.002339658,0.005416293],"category_scores_gemma":[0.01353278,0.001025497,0.001915732,0.0006433786,0.001323394,0.003716498,0.003020163,0.004840781,0.003209975],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001232913,"about_ca_system_score_gemma":0.002425046,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004090344,"about_ca_topic_score_gemma":0.008836929,"domain_scores_codex":[0.9973816,0.001177215,0.000139266,0.0006325143,0.0004510693,0.0002182536],"domain_scores_gemma":[0.9943033,0.003941778,0.0002909821,0.0008628582,0.0004003123,0.0002007933],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006882554,0.000433655,0.003933059,0.0004338909,0.0003222189,0.0005137786,0.0002565425,0.6219693,0.007989462,0.01329989,0.03122136,0.3189386],"study_design_scores_gemma":[0.00002718143,0.00004559353,0.00006745951,0.00001285525,0.0000145007,0.00004019599,0.00001793156,0.9890164,0.001378212,0.008602642,0.0007655699,0.00001151986],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02194799,0.001209415,0.9494362,0.001209434,0.0001730372,0.0002262783,0.0006538638,0.02347949,0.001664279],"genre_scores_gemma":[0.6229669,0.0007277485,0.3580786,0.002358849,0.0003207222,0.0006868853,0.004550403,0.002510909,0.007798892],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005416293,"threshold_uncertainty_score":0.01838124,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01736622173029912,"score_gpt":0.2995262720487557,"score_spread":0.2821600503184566,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}