{"id":"W4416384622","doi":"10.1016/j.engappai.2025.113111","title":"Trustworthy requirements for foundation models—A comprehensive survey and roadmap","year":2025,"lang":"en","type":"article","venue":"Engineering Applications of Artificial Intelligence","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Carleton University","funders":"Research Ireland; Canada Research Chairs; Science Foundation Ireland","keywords":"Trustworthiness; Foundation (evidence); Process (computing); Adversarial system; Generalization","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01576351,0.001593577,0.001734314,0.005644587,0.002249809,0.008749817,0.003295076,0.004087825,0.003999733],"category_scores_gemma":[0.05593146,0.001941622,0.002386501,0.004086515,0.005220203,0.01703655,0.004588122,0.005588292,0.001716272],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004798019,"about_ca_system_score_gemma":0.006489011,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004955789,"about_ca_topic_score_gemma":0.002246998,"domain_scores_codex":[0.9787021,0.005693337,0.002975387,0.001904433,0.009773169,0.0009516481],"domain_scores_gemma":[0.928261,0.04952923,0.003995785,0.00621814,0.01083478,0.001160885],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001079379,0.0001529356,0.003508336,0.004844291,0.0001162019,0.0009038306,0.002087642,0.01485117,0.001586783,0.7810487,0.009876411,0.1809157],"study_design_scores_gemma":[0.00002521732,0.0001730062,0.001781806,0.007440032,0.0001465287,0.00168799,0.001940107,0.04841552,0.00220652,0.7021111,0.2338908,0.000181389],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"review","genre_scores_codex":[0.03060644,0.2014824,0.6559556,0.02691335,0.001284797,0.001026325,0.001069265,0.00103751,0.08062431],"genre_scores_gemma":[0.3988177,0.2577745,0.3244196,0.003603076,0.002443886,0.001470348,0.002723468,0.0008884337,0.007858988],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.01576351,"threshold_uncertainty_score":0.08336639,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05329427709778476,"score_gpt":0.3276717843211859,"score_spread":0.2743775072234011,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}