{"id":"W4407304464","doi":"10.1109/access.2025.3540388","title":"BVQA: Connecting Language and Vision Through Multimodal Attention for Open-Ended Question Answering","year":2025,"lang":"en","type":"article","venue":"IEEE Access","topic":"Speech and dialogue systems","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"Athabasca University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Question answering; Natural language processing; Closed-ended question; Artificial intelligence; Human–computer interaction; Linguistics; Philosophy","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001992973,0.002138064,0.0009056614,0.001808108,0.0007848664,0.001443284,0.002862252,0.002908552,0.007863552],"category_scores_gemma":[0.007352241,0.0004681386,0.001825568,0.001159055,0.0009850529,0.003763468,0.002981676,0.002866466,0.003061028],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002377132,"about_ca_system_score_gemma":0.001040674,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02093086,"about_ca_topic_score_gemma":0.02231544,"domain_scores_codex":[0.998605,0.000502506,0.0000564449,0.0005625491,0.000129217,0.0001444761],"domain_scores_gemma":[0.9982355,0.001028886,0.00009088239,0.0002733447,0.0002652136,0.0001061589],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001167951,0.0009747833,0.006306342,0.001350339,0.0003206142,0.0006339087,0.001621623,0.05686874,0.04407854,0.01183461,0.06955343,0.8052893],"study_design_scores_gemma":[0.0001333868,0.0004910103,0.00481606,0.0001271555,0.0001434862,0.0003327088,0.0005609292,0.9096206,0.02324597,0.03324602,0.02719641,0.00008628144],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.18298,0.008693886,0.722086,0.003452439,0.000778056,0.002130735,0.02116328,0.03946147,0.01925403],"genre_scores_gemma":[0.6607285,0.001154747,0.2821283,0.002562919,0.0002947714,0.001545374,0.0388119,0.000547178,0.01222635],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02093086,"threshold_uncertainty_score":0.04161805,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02959379945198485,"score_gpt":0.386820533552708,"score_spread":0.3572267341007231,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}