{"id":"W1964721431","doi":"10.1109/mmsp.2012.6343443","title":"Audio-visual vibraphone transcription in real time","year":2012,"lang":"en","type":"article","venue":"","topic":"Music and Audio Processing","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Victoria","funders":"National Research Council Canada; Coordenação de Aperfeiçoamento de Pessoal de Nível Superior; National Science Council","keywords":"Computer science; Transcription (linguistics); Speech recognition; Spectrogram; Audio signal processing; Audio signal; Artificial intelligence; Computer vision; Speech coding","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002468351,0.00006750697,0.00008503126,0.00007614063,0.00004111521,0.00005440405,0.000191047,0.00003842796,0.0001723178],"category_scores_gemma":[0.000003709059,0.00005778505,0.00002594792,0.000297741,0.00001605434,0.001068722,0.00003493623,0.00005940196,0.0002742088],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00001887018,"about_ca_system_score_gemma":0.00002183702,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00003655643,"about_ca_topic_score_gemma":0.000003965411,"domain_scores_codex":[0.9993145,0.00002721861,0.000124652,0.0001395242,0.0001323025,0.0002618267],"domain_scores_gemma":[0.9997643,0.00001483474,0.0000245258,0.0001164907,0.00001113456,0.0000687471],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"observational","study_design_scores_codex":[0.00001671265,0.00051153,0.01002994,0.00004674997,0.00001317778,0.000009636391,0.00826111,0.00002789917,0.5603125,0.0409792,0.01227167,0.3675199],"study_design_scores_gemma":[0.004125807,0.0003661465,0.4111492,0.0002465494,0.00002413259,0.0001162379,0.0003115896,0.1950788,0.3416614,0.00889113,0.03575763,0.002271379],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3772084,0.0001136292,0.5511867,0.001022717,0.000339728,0.00007502906,2.02058e-7,0.0002564311,0.06979722],"genre_scores_gemma":[0.9758889,0.000009456121,0.02181264,0.0005735161,0.0001160324,0.000003302259,0.000001004564,0.000004137446,0.001591008],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.5986806,"threshold_uncertainty_score":0.352449,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01707121253792412,"score_gpt":0.2559251674103572,"score_spread":0.2388539548724331,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}