{"id":"W2991485158","doi":"10.48550/arxiv.1911.13280","title":"Deconstructing and reconstructing word embedding algorithms","year":2019,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Topic Modeling","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Word2vec; Pointwise mutual information; Word (group theory); Word embedding; Computer science; Pointwise; Embedding; Algorithm; Feature (linguistics); Construct (python library); Artificial intelligence; Natural language processing; Mutual information; Mathematics; Linguistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0003852288,0.0003319234,0.0004060442,0.0002963093,0.0002168112,0.0002847895,0.001254051,0.0003053762,0.00001597852],"category_scores_gemma":[0.00006600164,0.0004169693,0.0001329551,0.0003021976,0.00009557208,0.0005956669,0.003245855,0.0008142809,0.00002701842],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001638254,"about_ca_system_score_gemma":0.0001787438,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001019818,"about_ca_topic_score_gemma":0.000009642398,"domain_scores_codex":[0.9975651,0.0001036892,0.0002866585,0.001514434,0.00008532491,0.0004448059],"domain_scores_gemma":[0.9980127,0.0002095569,0.000363082,0.00114978,0.0001030904,0.0001618145],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001144692,0.00002531857,0.06478327,0.0003371096,0.0002125723,0.000371969,0.001304428,0.5865715,0.00005978025,0.1545627,0.00002844377,0.1917314],"study_design_scores_gemma":[0.0002891562,0.000008740708,0.0001617228,0.0002099657,0.00002843752,0.00007237859,0.0003580593,0.9714734,0.00005641259,0.02684376,0.00005609442,0.0004418756],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4503804,0.0000670952,0.5465367,0.00002992668,0.001050487,0.0001413582,0.000002332435,0.0001830796,0.001608625],"genre_scores_gemma":[0.8719609,0.00007105992,0.1274181,0.00004041229,0.0001207069,3.86516e-7,0.000001939425,0.0000180836,0.0003683146],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.4215806,"threshold_uncertainty_score":0.9998282,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07496298646145166,"score_gpt":0.2028099849556326,"score_spread":0.1278469984941809,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}