{"id":"W4400527955","doi":"10.1109/fg59268.2024.10582018","title":"Audio-Visual Person Verification Based on Recursive Fusion of Joint Cross-Attention","year":2024,"lang":"en","type":"article","venue":"","topic":"Video Surveillance and Tracking Methods","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"Computer Research Institute of Montréal","funders":"Government of Canada","keywords":"Joint (building); Computer science; Audio visual; Joint attention; Fusion; Speech recognition; Artificial intelligence; Human–computer interaction; Multimedia; Psychology; Engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008599014,0.00009418205,0.0001182521,0.0001680758,0.00006663438,0.0001558398,0.000190013,0.00005932765,0.00004504629],"category_scores_gemma":[0.00007862566,0.00007811978,0.0001062491,0.0004124318,0.00003382516,0.000275361,0.00002566968,0.0001015144,0.00008017381],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004790786,"about_ca_system_score_gemma":0.00006123867,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002578447,"about_ca_topic_score_gemma":0.00000229688,"domain_scores_codex":[0.9988962,0.0001330133,0.000182155,0.0003639758,0.000287213,0.0001373886],"domain_scores_gemma":[0.999351,0.0001303551,0.00006034787,0.000316523,0.0001052671,0.00003654684],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00008967776,0.0004060463,0.006656924,0.000416473,0.00005337873,0.00004164502,0.001450263,0.002445278,0.135623,0.1331157,0.002607998,0.7170936],"study_design_scores_gemma":[0.00038744,0.0005729098,0.2458457,0.000289635,0.000009371935,0.00000570715,0.00005785362,0.6625106,0.08657204,0.002290551,0.001197504,0.0002606479],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.149,0.00007051358,0.8445889,0.001081274,0.0008737713,0.0001236485,0.000001949357,0.0002041254,0.00405577],"genre_scores_gemma":[0.9645827,0.0000077889,0.03483108,0.0001160854,0.00005784256,0.00000784435,0.000007959943,0.000007386315,0.0003813483],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8155826,"threshold_uncertainty_score":0.3185632,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04526092622076203,"score_gpt":0.3434943451829485,"score_spread":0.2982334189621864,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}