{"id":"W4400276083","doi":"10.1109/jstsp.2024.3422823","title":"Incongruity-Aware Cross-Modal Attention for Audio-Visual Fusion in Dimensional Emotion Recognition","year":2024,"lang":"en","type":"article","venue":"IEEE Journal of Selected Topics in Signal Processing","topic":"Speech and Audio Processing","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":true,"ca_institutions":"Computer Research Institute of Montréal","funders":"","keywords":"Computer science; Audio visual; Modal; Speech recognition; Emotion recognition; Artificial intelligence; Sensor fusion; Visual attention; Fusion; Pattern recognition (psychology); Computer vision; Perception; Psychology; Multimedia","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001361585,0.0009236738,0.0008650079,0.0006684748,0.0003831181,0.0008872963,0.001501959,0.0008836746,0.002475749],"category_scores_gemma":[0.002662472,0.0003076342,0.0009554474,0.0006846596,0.00055747,0.001363541,0.002103312,0.001614628,0.0006696459],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006210551,"about_ca_system_score_gemma":0.0006439553,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004215064,"about_ca_topic_score_gemma":0.006102543,"domain_scores_codex":[0.9994838,0.0001128512,0.00002308908,0.0001803515,0.00009933335,0.0001004864],"domain_scores_gemma":[0.9994721,0.0002617322,0.00004355307,0.00006724986,0.000113048,0.00004232951],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000989884,0.0005287811,0.003630324,0.0002839567,0.0002676874,0.0002480605,0.0004876445,0.1794409,0.08707379,0.008402131,0.008114235,0.7105327],"study_design_scores_gemma":[0.00001620897,0.0001053636,0.0021745,0.00002014077,0.000079894,0.00009790236,0.00005491772,0.9817783,0.007914391,0.005805357,0.001929814,0.00002332248],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08984233,0.003237458,0.899056,0.0006493426,0.0002448649,0.0001211486,0.0002300584,0.001615666,0.005003048],"genre_scores_gemma":[0.9077383,0.0009431402,0.08528834,0.0006734969,0.0002671937,0.00016465,0.0005033342,0.0001531356,0.004268488],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004215064,"threshold_uncertainty_score":0.008381069,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02453449477891871,"score_gpt":0.3160550002741921,"score_spread":0.2915205054952734,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}