{"id":"W4387225818","doi":"10.48550/arxiv.2309.16569","title":"Audio-Visual Speaker Verification via Joint Cross-Attention","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Speech and Audio Processing","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Government of Canada","keywords":"Computer science; Leverage (statistics); Modal; Speech recognition; Audio visual; Concatenation (mathematics); Feature (linguistics); Artificial intelligence; Fusion; Pattern recognition (psychology); Multimedia","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00308824,0.002112417,0.002073304,0.001863417,0.000763699,0.001349861,0.001823541,0.001955112,0.005368572],"category_scores_gemma":[0.004504555,0.0005460872,0.002063073,0.0007936187,0.000714733,0.001904818,0.004034242,0.002156744,0.004223283],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007461054,"about_ca_system_score_gemma":0.001349333,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006513226,"about_ca_topic_score_gemma":0.01053252,"domain_scores_codex":[0.9972116,0.0006261968,0.0001215367,0.0009426645,0.0007233558,0.000374613],"domain_scores_gemma":[0.998175,0.0006320797,0.0001487502,0.0004099892,0.0005312965,0.0001028663],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009294533,0.0002217962,0.001969602,0.0002029655,0.0003774698,0.0003456331,0.0001559863,0.02972244,0.06728615,0.002034803,0.007235847,0.8895178],"study_design_scores_gemma":[0.00006300904,0.0002988605,0.00448147,0.00005148389,0.0002568701,0.000795275,0.0001237628,0.9129617,0.06779986,0.007902214,0.005198045,0.00006732899],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06059942,0.003650262,0.9148919,0.0004959605,0.0004623098,0.0002144435,0.0007378899,0.01091436,0.008033423],"genre_scores_gemma":[0.7200332,0.001318797,0.2586668,0.0008445585,0.0003872061,0.0001667265,0.003908888,0.0006795787,0.0139943],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006513226,"threshold_uncertainty_score":0.01795959,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1148910146309046,"score_gpt":0.2293357851523178,"score_spread":0.1144447705214132,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}