{"id":"W1964721431","doi":"10.1109/mmsp.2012.6343443","title":"Audio-visual vibraphone transcription in real time","year":2012,"lang":"en","type":"article","venue":"","topic":"Music and Audio Processing","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Victoria","funders":"National Research Council Canada; Coordenação de Aperfeiçoamento de Pessoal de Nível Superior; National Science Council","keywords":"Computer science; Transcription (linguistics); Speech recognition; Spectrogram; Audio signal processing; Audio signal; Artificial intelligence; Computer vision; Speech coding","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001022386,0.001059383,0.001071294,0.0009137674,0.0004714524,0.001644618,0.001131709,0.001920189,0.00876034],"category_scores_gemma":[0.004998773,0.0002921812,0.0003649213,0.0006372097,0.0005221278,0.001098749,0.00136435,0.0005741366,0.006923842],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002570768,"about_ca_system_score_gemma":0.0003051086,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007791704,"about_ca_topic_score_gemma":0.001442159,"domain_scores_codex":[0.9984214,0.0003027386,0.00009320502,0.0004411286,0.000590413,0.0001510667],"domain_scores_gemma":[0.997787,0.0008593895,0.0002569558,0.000428767,0.0005222246,0.0001457481],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.002934558,0.0001088879,0.002369429,0.000776433,0.00006547053,0.001140919,0.0004418492,0.003069049,0.5164123,0.0008445527,0.005004697,0.4668318],"study_design_scores_gemma":[0.0004131259,0.001146111,0.02265256,0.0002469847,0.0001793304,0.00868158,0.0009003569,0.1390243,0.790357,0.004569944,0.03161596,0.0002127035],"study_design_candidate":"bench_or_experimental","study_design_consensus":"bench_or_experimental","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1597045,0.001339343,0.8055057,0.0003163529,0.0006002086,0.0004097762,0.001871554,0.01791425,0.01233823],"genre_scores_gemma":[0.5555171,0.0005325012,0.4273205,0.0003671846,0.0002045457,0.0002713584,0.002434542,0.001092055,0.01226032],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00876034,"threshold_uncertainty_score":0.02930623,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01707121253792412,"score_gpt":0.2559251674103572,"score_spread":0.2388539548724331,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}