{"id":"W4400527955","doi":"10.1109/fg59268.2024.10582018","title":"Audio-Visual Person Verification Based on Recursive Fusion of Joint Cross-Attention","year":2024,"lang":"en","type":"article","venue":"","topic":"Video Surveillance and Tracking Methods","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"Computer Research Institute of Montréal","funders":"Government of Canada","keywords":"Joint (building); Computer science; Audio visual; Joint attention; Fusion; Speech recognition; Artificial intelligence; Human–computer interaction; Multimedia; Psychology; Engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001987316,0.001375328,0.001610708,0.00152302,0.0005048164,0.001086393,0.002146041,0.001263148,0.003448989],"category_scores_gemma":[0.003780514,0.0005503616,0.00145538,0.0009385057,0.0006493516,0.002159453,0.003069164,0.001860006,0.002042666],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008530348,"about_ca_system_score_gemma":0.001017201,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01124537,"about_ca_topic_score_gemma":0.01266613,"domain_scores_codex":[0.99862,0.0001869996,0.00005665317,0.0005566339,0.0003538435,0.0002258705],"domain_scores_gemma":[0.9987419,0.0003495129,0.0001099899,0.0002766805,0.0004297094,0.00009226664],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007296001,0.0002969617,0.003058455,0.000173778,0.0003191621,0.0002858728,0.0002481745,0.08999478,0.05682956,0.005208331,0.004840611,0.8380147],"study_design_scores_gemma":[0.0000147603,0.000139263,0.002431784,0.00002371012,0.0000804821,0.0002025888,0.00003381832,0.9757832,0.01503376,0.004631686,0.001595772,0.00002918165],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03946374,0.001076496,0.9514945,0.000236084,0.0001788199,0.0001256713,0.0003111985,0.003397777,0.003715665],"genre_scores_gemma":[0.7650261,0.0007291315,0.2237189,0.0005006444,0.0002099389,0.0001254249,0.001515642,0.0002780883,0.007896177],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01124537,"threshold_uncertainty_score":0.02235985,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04526092622076203,"score_gpt":0.3434943451829485,"score_spread":0.2982334189621864,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}