{"id":"W4402980239","doi":"10.1109/icme57554.2024.10687371","title":"Cross-Attention is not always needed: Dynamic Cross-Attention for Audio-Visual Dimensional Emotion Recognition","year":2024,"lang":"en","type":"article","venue":"","topic":"Speech and Audio Processing","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Computer Research Institute of Montréal","funders":"","keywords":"Computer science; Audio visual; Speech recognition; Visual attention; Emotion recognition; Human–computer interaction; Multimedia; Psychology; Perception","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.0005971661,0.0002582682,0.0001907299,0.0003021946,0.0005217972,0.002150802,0.0003154099,0.0001809018,0.0002057524],"category_scores_gemma":[0.00006152398,0.0002414598,0.0002727736,0.0005613102,0.00008338682,0.002679849,0.0001452094,0.0001855469,0.0006067797],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001651701,"about_ca_system_score_gemma":0.0001134082,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002564408,"about_ca_topic_score_gemma":0.000007732928,"domain_scores_codex":[0.9976133,0.00003392845,0.0004798996,0.0008882142,0.0005052122,0.0004795139],"domain_scores_gemma":[0.9990119,0.0001056922,0.0001258666,0.0002554498,0.0003827184,0.0001183362],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009189362,0.0002324465,0.001265974,0.0004784738,0.00009581791,0.00002191199,0.000262543,0.0001084972,0.2691915,0.001022058,0.003911394,0.7233175],"study_design_scores_gemma":[0.001722767,0.0004433148,0.03900779,0.0005661977,0.00006559774,0.0001597886,0.00009064197,0.7006512,0.2348445,0.01975206,0.001758833,0.0009372857],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4906985,0.00009371939,0.5052755,0.001355926,0.001463215,0.0002393563,0.000024106,0.0005211685,0.0003284311],"genre_scores_gemma":[0.9437574,0.00001603393,0.04575621,0.001221255,0.0003064401,0.00006503773,0.0002626145,0.00003699448,0.008577997],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.7223802,"threshold_uncertainty_score":0.998885,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02506385482528575,"score_gpt":0.3320986240909823,"score_spread":0.3070347692656966,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}