{"id":"W4382318126","doi":"10.1609/aaai.v37i8.26162","title":"Self-Supervised Audio-Visual Representation Learning with Relaxed Cross-Modal Synchronicity","year":2023,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Music and Audio Processing","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University; Vector Institute","funders":"Mitacs","keywords":"Computer science; Modal; Synchronicity; Artificial intelligence; Representation (politics); Asynchronous communication; Speech recognition; Feature learning; Pattern recognition (psychology); Action (physics); Natural language processing; Machine learning","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001241807,0.00168647,0.001059195,0.0008476861,0.0004012574,0.0009062307,0.003185362,0.00173259,0.003121933],"category_scores_gemma":[0.004090149,0.0005739836,0.001133683,0.0008756892,0.0009636626,0.002036127,0.002082017,0.002602804,0.00168405],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007728265,"about_ca_system_score_gemma":0.00104274,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004220868,"about_ca_topic_score_gemma":0.007475428,"domain_scores_codex":[0.9991003,0.0001943984,0.00003350999,0.0004140732,0.0001568774,0.000100885],"domain_scores_gemma":[0.9984823,0.0004736809,0.0001739863,0.0004705401,0.0002897772,0.0001096317],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006034346,0.0006783886,0.002634388,0.0003034257,0.0002885337,0.000191218,0.0002204508,0.3229495,0.02634136,0.005114672,0.02083283,0.6198418],"study_design_scores_gemma":[0.00002667866,0.00009838516,0.0003428041,0.00001018342,0.00001750719,0.00004420721,0.00002085564,0.9906968,0.00411716,0.003653086,0.0009621337,0.00001021815],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.07266077,0.0008613592,0.9090573,0.0004051727,0.0001774839,0.0001659893,0.0008454303,0.01094317,0.004883382],"genre_scores_gemma":[0.7553485,0.0002805117,0.2265174,0.0008688748,0.0002194876,0.0003449342,0.005728736,0.0006283043,0.01006328],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004220868,"threshold_uncertainty_score":0.01044393,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06273058182013519,"score_gpt":0.3256660684038744,"score_spread":0.2629354865837392,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}