{"id":"W2964122685","doi":"10.18653/v1/p19-1153","title":"Towards Lossless Encoding of Sentences","year":2019,"lang":"","type":"article","venue":"PolyPublie (École Polytechnique de Montréal)","topic":"Topic Modeling","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Lossless compression; Computer science; Sentence; Encoding (memory); Embedding; Feature (linguistics); Natural language processing; Focus (optics); Artificial intelligence; Task (project management); Sequence labeling; Compression (physics); Sequence (biology); Data compression; Speech recognition; Linguistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.002018106,0.0007856846,0.001190095,0.0008891749,0.0002676698,0.0005475331,0.003570549,0.0006471404,0.0002294896],"category_scores_gemma":[0.0002495821,0.0008273559,0.0005601731,0.001546853,0.0002488712,0.001445104,0.001757036,0.0009508726,0.0001143468],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006188896,"about_ca_system_score_gemma":0.001090705,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01609175,"about_ca_topic_score_gemma":0.0005554516,"domain_scores_codex":[0.9934075,0.0003670788,0.001656483,0.001519908,0.001394577,0.001654464],"domain_scores_gemma":[0.9946584,0.0002306723,0.001013391,0.003058251,0.0004748534,0.000564417],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001581547,0.0008634096,0.1981377,0.000988347,0.0003128939,0.0001880514,0.005399857,0.03614147,0.04483994,0.3743749,0.0005715346,0.3380237],"study_design_scores_gemma":[0.0007442347,0.0003535394,0.01346225,0.000621602,0.0000569405,0.0001510736,0.0004607954,0.9354562,0.04196627,0.005090679,0.0007246896,0.000911725],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2830577,0.002930799,0.7048396,0.002908662,0.001221611,0.001045812,0.00003067206,0.0003892145,0.003575972],"genre_scores_gemma":[0.840884,0.0006053477,0.1556398,0.0009871376,0.000233146,0.00009225745,0.000004467672,0.00006676975,0.001487034],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8993147,"threshold_uncertainty_score":0.9994177,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0172286681527959,"score_gpt":0.2410758530218186,"score_spread":0.2238471848690227,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}