{"id":"W3093096945","doi":"10.1145/3422852.3423486","title":"Intra and Inter-modality Interactions for Audio-visual Event Detection","year":2020,"lang":"en","type":"article","venue":"","topic":"Music and Audio Processing","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Sherbrooke","funders":"","keywords":"Computer science; Modality (human–computer interaction); Audio visual; Modalities; Event (particle physics); Stimulus modality; Artificial intelligence; Visualization; Speech recognition; Audio signal processing; Audio signal; Sensory system; Speech coding; Multimedia","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001173271,0.002496826,0.000783332,0.001223567,0.0005605206,0.0009247728,0.001876324,0.001715956,0.005365097],"category_scores_gemma":[0.002885531,0.0003161957,0.00109307,0.0009459818,0.0003893428,0.002449209,0.001659299,0.002177313,0.002710214],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00069553,"about_ca_system_score_gemma":0.0006865056,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006530863,"about_ca_topic_score_gemma":0.01599944,"domain_scores_codex":[0.9991996,0.0001761339,0.00003991786,0.0003466876,0.000119679,0.0001180101],"domain_scores_gemma":[0.9992238,0.0003512356,0.00005692986,0.0001805835,0.0001346251,0.00005281431],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001925526,0.0007859413,0.004980124,0.0008061152,0.0003856177,0.0005978617,0.0002516545,0.02719299,0.05435562,0.002353976,0.04944635,0.8569182],"study_design_scores_gemma":[0.0001574435,0.0006863174,0.01090055,0.0001356402,0.0003248699,0.0008393673,0.0003460702,0.8828983,0.05799705,0.01310563,0.03251874,0.00008999306],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2935706,0.01965169,0.6008027,0.00192946,0.001963521,0.000818872,0.02674286,0.03202243,0.02249786],"genre_scores_gemma":[0.7615756,0.002278988,0.1833151,0.0006878296,0.0005267765,0.0004413526,0.03257393,0.0004993336,0.01810114],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006530863,"threshold_uncertainty_score":0.01794803,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03034233145706322,"score_gpt":0.3061465161268468,"score_spread":0.2758041846697836,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}