{"id":"W4409361081","doi":"10.1609/aaai.v39i28.35203","title":"Stress-Testing of Multimodal Models in Medical Image-Based Report Generation","year":2025,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Topic Modeling","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"Fundação para a Ciência e a Tecnologia; Ministério da Ciência, Tecnologia e Ensino Superior; European Commission","keywords":"Stress testing (software); Computer science; Stress (linguistics); Artificial intelligence; Computer vision; Linguistics; Programming language; Philosophy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009423385,0.0001538758,0.0002552226,0.0001818113,0.0001176952,0.0001604552,0.001520655,0.0001120341,0.00001322955],"category_scores_gemma":[0.001709652,0.0001268004,0.00007031967,0.0007951462,0.0001753712,0.0003661655,0.0003184157,0.0002844299,0.000002435963],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0000499583,"about_ca_system_score_gemma":0.000458714,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003876017,"about_ca_topic_score_gemma":0.00006699918,"domain_scores_codex":[0.9977396,0.00002271987,0.0008807739,0.0004752293,0.000644302,0.0002374332],"domain_scores_gemma":[0.9982505,0.0001424499,0.0003917713,0.0003425427,0.0008186151,0.00005410542],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002858236,0.000272685,0.001774702,0.0001078378,0.000009776967,0.000006679999,0.0005380848,0.01615256,0.08537228,0.7455553,0.00003228693,0.1501492],"study_design_scores_gemma":[0.0000240868,0.00002143077,0.00006703803,0.0003539996,0.000002224936,0.00000162114,0.00004818156,0.6137801,0.3389873,0.04664848,0.000001380276,0.00006420761],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2654969,0.00001770854,0.7235536,0.00333854,0.000318426,0.0002876774,0.000001613564,0.00005090419,0.006934725],"genre_scores_gemma":[0.9481394,0.000005216803,0.05159917,0.000149748,0.00003875844,0.00001927138,5.343518e-7,0.00000517118,0.00004273354],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.6989069,"threshold_uncertainty_score":0.5170768,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1176988169821059,"score_gpt":0.3328827120237139,"score_spread":0.215183895041608,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}