{"id":"W4403407815","doi":"10.1109/icc51166.2024.10622985","title":"On the Out-of-Distribution Evaluation of ML-Based End-to-End Communications Systems","year":2024,"lang":"en","type":"article","venue":"","topic":"Error Correcting Code Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Manitoba","funders":"Futurewei Technologies","keywords":"End-to-end principle; Computer science; End user; Telecommunications; Computer network; World Wide Web","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002899942,0.0000723156,0.00009520914,0.00009759379,0.00006914591,0.00007154806,0.001067704,0.00003687481,0.00001845584],"category_scores_gemma":[0.0003897957,0.00005065013,0.00005196853,0.0005179264,0.00004675311,0.00009678208,0.0001668241,0.000115962,0.00002865552],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001308124,"about_ca_system_score_gemma":0.0001766562,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000198565,"about_ca_topic_score_gemma":0.00006218407,"domain_scores_codex":[0.9985452,0.0003912525,0.0002574644,0.0001747545,0.0005404015,0.0000908731],"domain_scores_gemma":[0.9971023,0.0009880993,0.00008235798,0.001432936,0.0003716454,0.00002262331],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000003123561,0.00009385607,0.00004982551,0.00005091972,0.00002389067,2.644091e-7,0.001017024,0.002063077,0.004412936,0.9494611,0.009234429,0.03358952],"study_design_scores_gemma":[0.00004255773,0.000103871,0.0001575925,0.000229818,0.00002091508,7.297239e-7,0.00006430928,0.9635034,0.03072255,0.003792457,0.001293924,0.0000679167],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.009639141,0.0001948082,0.9774782,0.00346829,0.0006004425,0.0005668558,0.0000171602,0.0004529073,0.007582188],"genre_scores_gemma":[0.9930469,0.000002313208,0.006713124,0.00006001331,0.00001021437,0.0000915971,0.0000141242,0.000005121592,0.00005656845],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9834078,"threshold_uncertainty_score":0.2065452,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1124957316790551,"score_gpt":0.3680758551219959,"score_spread":0.2555801234429408,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}