{"id":"W2980492205","doi":"10.1109/mlsp.2019.8918712","title":"Audio-Visual Fusion And Conditioning With Neural Networks For Event Recognition","year":2019,"lang":"en","type":"article","venue":"","topic":"Music and Audio Processing","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Sherbrooke","funders":"","keywords":"Computer science; Modality (human–computer interaction); Pooling; Event (particle physics); Concatenation (mathematics); Speech recognition; Artificial intelligence; Modalities; Feature (linguistics); Audio visual; Audio signal processing; Pattern recognition (psychology); Audio signal; Multimedia; Speech coding","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011942,0.000914152,0.0006400482,0.0004269109,0.0001916757,0.0006226274,0.001042314,0.0006516883,0.003361092],"category_scores_gemma":[0.001954748,0.0002979897,0.0006959614,0.0005522497,0.0005505256,0.001820045,0.0008941938,0.001324201,0.0006079235],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005611762,"about_ca_system_score_gemma":0.0003481478,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001875287,"about_ca_topic_score_gemma":0.001915039,"domain_scores_codex":[0.99961,0.00009302214,0.00002289268,0.0001277084,0.00007591811,0.00007051468],"domain_scores_gemma":[0.9995086,0.0002441757,0.00006002987,0.00006492052,0.00009398722,0.00002824846],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001072534,0.0003534252,0.001460966,0.0003922606,0.0003169471,0.0001617792,0.0001266153,0.2381177,0.123769,0.01032221,0.00237318,0.6215335],"study_design_scores_gemma":[0.00000976479,0.0001166048,0.0008292852,0.0000171034,0.00004475555,0.00004565843,0.00001823197,0.9636263,0.02830695,0.006115054,0.0008556597,0.00001464692],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06061235,0.00150958,0.9339377,0.0002665706,0.0001530646,0.00006480583,0.0001282829,0.001318241,0.002009355],"genre_scores_gemma":[0.8159496,0.0007442426,0.1798366,0.000162445,0.0001384653,0.00007359238,0.0003125654,0.00009901917,0.00268335],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003361092,"threshold_uncertainty_score":0.011244,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01382782289089173,"score_gpt":0.2481879598178739,"score_spread":0.2343601369269822,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}