{"id":"W7125907148","doi":"10.1109/ase63991.2025.00380","title":"TrustVis: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models","year":2025,"lang":"","type":"article","venue":"","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Mila - Quebec Artificial Intelligence Institute; University of Alberta","funders":"","keywords":"Trustworthiness; Robustness (evolution); Voting; Natural language; Key (lock); User interface; Personalization; Feature (linguistics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01585438,0.001791159,0.001134819,0.003350404,0.001219028,0.004345269,0.001969756,0.001513342,0.003977804],"category_scores_gemma":[0.06772964,0.0008600377,0.001947669,0.001204387,0.002146412,0.005811939,0.00515801,0.002988602,0.001025312],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002895449,"about_ca_system_score_gemma":0.003370599,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00607796,"about_ca_topic_score_gemma":0.007694558,"domain_scores_codex":[0.9862113,0.007568224,0.001038491,0.001026122,0.003814931,0.0003409921],"domain_scores_gemma":[0.9763109,0.01400822,0.002562126,0.002866863,0.003572543,0.0006792731],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007075457,0.00024016,0.00988797,0.0009379892,0.0007241755,0.0003944483,0.001338854,0.50248,0.007871266,0.2072261,0.02681373,0.2413777],"study_design_scores_gemma":[0.00002847848,0.00008896923,0.0003931985,0.00008037854,0.00003702277,0.00007884193,0.00008128756,0.8956646,0.002538747,0.09623069,0.004732575,0.00004525227],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.005475028,0.0002897295,0.9857779,0.0003913261,0.00004662372,0.0002121591,0.0004656433,0.005618279,0.001723418],"genre_scores_gemma":[0.3491142,0.0003732308,0.6441572,0.0002969173,0.0001066808,0.0008148706,0.001787999,0.00167692,0.001672082],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01585438,"threshold_uncertainty_score":0.08384705,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03575871934778612,"score_gpt":0.3657391003013337,"score_spread":0.3299803809535476,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}