{"id":"W3211965499","doi":"","title":"TriBERT: Human-centric Audio-visual Representation Learning","year":2021,"lang":"en","type":"article","venue":"Neural Information Processing Systems","topic":"Music and Audio Processing","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Toronto; University of British Columbia","funders":"","keywords":"Computer science; Audio visual; Representation (politics); Artificial intelligence; Human–computer interaction; Visualization; Computer vision; Speech recognition; Natural language processing; Multimedia","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008093077,0.001025438,0.0008440571,0.0006398573,0.0004597004,0.001693852,0.002336758,0.00165484,0.0157124],"category_scores_gemma":[0.003132124,0.0003868996,0.000759638,0.0008737373,0.0006345819,0.002188207,0.002837179,0.001780701,0.006260058],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005486393,"about_ca_system_score_gemma":0.001075434,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004580512,"about_ca_topic_score_gemma":0.006070731,"domain_scores_codex":[0.9993863,0.00008883046,0.00001544419,0.0002303103,0.0002048379,0.00007430463],"domain_scores_gemma":[0.9994394,0.0001579929,0.00003126359,0.0002107172,0.00009637066,0.00006423148],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005302585,0.0002383404,0.0003551215,0.0001743129,0.000122526,0.000171551,0.00006441931,0.027305,0.04048609,0.01898098,0.05766888,0.8539026],"study_design_scores_gemma":[0.00008248793,0.000164167,0.0005501968,0.00002573675,0.00003780349,0.000186453,0.00003674104,0.8952616,0.03726273,0.04761167,0.01874818,0.00003221094],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.006386391,0.0007630468,0.9581434,0.0004867354,0.0005671484,0.0001306859,0.0009752577,0.02528979,0.007257564],"genre_scores_gemma":[0.3112059,0.00115279,0.6339411,0.001139879,0.0004330924,0.0004045174,0.003968498,0.002884975,0.04486918],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.0157124,"threshold_uncertainty_score":0.05256325,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02623141557770678,"score_gpt":0.2957809480702087,"score_spread":0.269549532492502,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}