{"id":"W7125957124","doi":"10.1109/smc58881.2025.11343454","title":"Grounded Multi-modal Conversation for Zero-shot Visual Question Answering","year":2025,"lang":"","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Carleton University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Question answering; Conversation; Comprehension; Modalities; Semantics (computer science); Natural language; Focus (optics); Bridging (networking)","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003852444,0.002281645,0.001597503,0.001168617,0.001226126,0.002081888,0.004732974,0.004097177,0.008016054],"category_scores_gemma":[0.01387387,0.0006475556,0.00215042,0.0006224885,0.001399439,0.006027703,0.006964142,0.003396036,0.003557073],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001361218,"about_ca_system_score_gemma":0.001729906,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007462903,"about_ca_topic_score_gemma":0.008206902,"domain_scores_codex":[0.9938606,0.003016087,0.0002332117,0.001692934,0.0008218098,0.0003753918],"domain_scores_gemma":[0.9951248,0.003161045,0.0001913435,0.0006585748,0.0005905589,0.0002737528],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002396038,0.001394028,0.004769375,0.002767044,0.0005833977,0.001118686,0.008793117,0.07460061,0.1086209,0.03419996,0.04384483,0.716912],"study_design_scores_gemma":[0.0001521338,0.0005462101,0.001216295,0.0001193804,0.0001377408,0.0006609808,0.001839029,0.8583114,0.02669413,0.08493565,0.0252385,0.0001485602],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02988501,0.002096939,0.9429682,0.0009358391,0.0001543143,0.0006180527,0.001102696,0.01810584,0.004133101],"genre_scores_gemma":[0.4848523,0.0005933625,0.5012689,0.001724677,0.000208985,0.0009129167,0.005156337,0.0007474716,0.004535095],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008016054,"threshold_uncertainty_score":0.02681637,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03046320982700265,"score_gpt":0.3708238761415693,"score_spread":0.3403606663145667,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}