{"id":"W2115230584","doi":"","title":"A Critical Reassessment of Evaluation Baselines for Speech Summarization","year":2008,"lang":"en","type":"article","venue":"","topic":"Speech Recognition and Synthesis","field":"Computer Science","cited_by":73,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Automatic summarization; Computer science; Speech recognition; Speech analytics; Voice activity detection; Natural language processing; Speech processing; Surprise; Speech synthesis; Artificial intelligence; Information retrieval","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1452134,0.001954155,0.002401266,0.006977695,0.004076047,0.009848238,0.004370946,0.003003632,0.003895559],"category_scores_gemma":[0.2890623,0.0007042802,0.001422793,0.005953493,0.002429885,0.009657215,0.003563547,0.005429569,0.003204941],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005254144,"about_ca_system_score_gemma":0.002500396,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004965792,"about_ca_topic_score_gemma":0.00769225,"domain_scores_codex":[0.8993386,0.05439787,0.008725158,0.008597849,0.02743298,0.001507476],"domain_scores_gemma":[0.7024553,0.1489957,0.007950052,0.02403033,0.113036,0.003532574],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.003816736,0.001052773,0.02156703,0.00413907,0.001050716,0.0002183129,0.003126755,0.007375272,0.02450257,0.02840547,0.1716604,0.7330849],"study_design_scores_gemma":[0.001737212,0.01052199,0.1557378,0.00954261,0.002324198,0.001810889,0.01145502,0.1359119,0.1131149,0.1372344,0.4193876,0.001221385],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"review","genre_scores_codex":[0.2383964,0.1340672,0.4140331,0.09764188,0.01935833,0.002639306,0.0160273,0.01628164,0.06155479],"genre_scores_gemma":[0.6824093,0.01200305,0.2573032,0.007380321,0.004713912,0.001952776,0.02259174,0.003406215,0.008239485],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.8547866,"threshold_uncertainty_score":0.7679712,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08207451475019102,"score_gpt":0.3518459785605035,"score_spread":0.2697714638103125,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}