{"id":"W4409361081","doi":"10.1609/aaai.v39i28.35203","title":"Stress-Testing of Multimodal Models in Medical Image-Based Report Generation","year":2025,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Topic Modeling","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"Fundação para a Ciência e a Tecnologia; Ministério da Ciência, Tecnologia e Ensino Superior; European Commission","keywords":"Stress testing (software); Computer science; Stress (linguistics); Artificial intelligence; Computer vision; Linguistics; Programming language; Philosophy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01568874,0.0008912881,0.0006323767,0.0007382428,0.0005641672,0.002828994,0.002378462,0.002135489,0.003552934],"category_scores_gemma":[0.1394867,0.0006399833,0.0008124232,0.0004457809,0.002531323,0.005305213,0.00339071,0.001832756,0.0009620388],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001152199,"about_ca_system_score_gemma":0.001324745,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001717595,"about_ca_topic_score_gemma":0.001033509,"domain_scores_codex":[0.9881052,0.007146115,0.0005970603,0.001214109,0.002481341,0.000456088],"domain_scores_gemma":[0.9062104,0.07053845,0.004325886,0.01215102,0.005381252,0.00139297],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.004417167,0.001608063,0.04590237,0.0005810865,0.0003534731,0.001580778,0.008062392,0.2851751,0.06194646,0.1048669,0.006264803,0.4792415],"study_design_scores_gemma":[0.00005878027,0.0004305099,0.001963394,0.00005007439,0.00004228377,0.0001691993,0.0003456938,0.9292371,0.02492172,0.04136897,0.001352939,0.00005923433],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.298064,0.0002459227,0.6920182,0.001978506,0.0001598542,0.0002629325,0.000192022,0.003512545,0.003565958],"genre_scores_gemma":[0.9344956,0.00006489663,0.06419389,0.0002027361,0.00004413789,0.0001242215,0.0001552379,0.0002245975,0.0004947499],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01568874,"threshold_uncertainty_score":0.08297092,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1176988169821059,"score_gpt":0.3328827120237139,"score_spread":0.215183895041608,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}