{"id":"W3011993190","doi":"10.1109/iiswc47752.2019.9041972","title":"Deep Learning Language Modeling Workloads: Where Time Goes on Graphics Processors","year":2019,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Softmax function; Computer science; Graphics; Language model; Vocabulary; Transformer; Deep learning; Layer (electronics); Computation; Parallel computing; Artificial intelligence; Programming language; Operating system","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0002567703,0.0001508291,0.000156983,0.0001165864,0.00008996644,0.0001663088,0.0006932914,0.00008416748,0.0001350407],"category_scores_gemma":[0.0000319752,0.0001273449,0.00006064588,0.0002966896,0.000008616124,0.0004008909,0.0001776486,0.0003111467,0.0008982641],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002436416,"about_ca_system_score_gemma":0.00002650611,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0000619206,"about_ca_topic_score_gemma":0.00002257591,"domain_scores_codex":[0.9986639,0.00004377138,0.0001896122,0.00046424,0.0003225169,0.0003159678],"domain_scores_gemma":[0.9992666,0.00006444788,0.00005348654,0.0004888049,0.00005440193,0.00007227869],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000007346762,0.00004171224,0.002040629,0.00005684114,0.00002005087,0.00001125606,0.004375878,0.9204523,0.0006634888,0.0288543,0.00004247342,0.04343375],"study_design_scores_gemma":[0.0001522649,0.00004279072,0.00001831629,0.00007252589,0.00000219458,0.000002901621,0.0002302817,0.9981293,0.0001475812,0.0008428603,0.0001768828,0.0001820836],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.36422,0.0003601092,0.6212736,0.0003487733,0.0001099214,0.0001278247,6.547794e-8,0.0004534381,0.01310629],"genre_scores_gemma":[0.9675742,0.00002521551,0.02561133,0.0003659166,0.0000607715,0.000006235442,9.793986e-7,0.00001672655,0.006338584],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.6033542,"threshold_uncertainty_score":0.9998797,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.009532136131513099,"score_gpt":0.2252336733998364,"score_spread":0.2157015372683233,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}