{"id":"W4317383069","doi":"10.1109/robio55434.2022.10011692","title":"Real-time Architecture for Audio-Visual Active Speaker Detection","year":2022,"lang":"en","type":"article","venue":"2022 IEEE International Conference on Robotics and Biomimetics (ROBIO)","topic":"Speech and Audio Processing","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Robot; Frame (networking); Code (set theory); Architecture; Artificial intelligence; Frame rate; Speech recognition; Quality (philosophy)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002568175,0.0002109458,0.0001945269,0.0002778512,0.0004197896,0.0002993826,0.0006462901,0.00006220896,0.0001443192],"category_scores_gemma":[0.00003766115,0.0002054655,0.00009555619,0.0002614258,0.00007258917,0.0001336966,0.0003060628,0.0002730062,0.00001606761],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001394208,"about_ca_system_score_gemma":0.000111038,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001174254,"about_ca_topic_score_gemma":0.000009537674,"domain_scores_codex":[0.9984293,0.00006149789,0.0002546882,0.0005380407,0.0004316315,0.0002848644],"domain_scores_gemma":[0.9991851,0.0001166142,0.0001967511,0.0002060372,0.0001980766,0.00009739232],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0002882307,0.0003537848,0.00003603347,0.00002542762,0.0001884613,0.00002303039,0.0004799021,0.008226011,0.7911591,0.0246228,0.001073267,0.173524],"study_design_scores_gemma":[0.001858716,0.001742656,0.0003124644,0.00005527985,0.00005284007,0.000135034,0.000250394,0.4729404,0.4823112,0.03518888,0.00427389,0.0008781675],"study_design_candidate":"bench_or_experimental","study_design_consensus":"bench_or_experimental","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09814212,0.00005119819,0.8780783,0.01158867,0.004323218,0.0008039753,0.0002882088,0.0002825747,0.006441765],"genre_scores_gemma":[0.9511777,0.00007602479,0.04565451,0.0005329697,0.0002778369,0.00007134912,0.00007691083,0.00002766218,0.002105019],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8530356,"threshold_uncertainty_score":0.8378639,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02706687756412575,"score_gpt":0.2892053514631431,"score_spread":0.2621384738990174,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}