{"id":"W2294768574","doi":"10.1109/icppw.2015.42","title":"Efficient Parallelization of the Google Trigram Method for Document Relatedness Computation","year":2015,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Trigram; Computation; Set (abstract data type); Construct (python library); Theoretical computer science; Word (group theory); Parallel computing; Artificial intelligence; Algorithm; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006748628,0.00006003095,0.00013837,0.00007392055,0.00006940807,0.00008719369,0.0004232349,0.0000325189,0.00003825869],"category_scores_gemma":[0.001504986,0.00003204263,0.00007482933,0.0005025314,0.00003375216,0.00008198469,0.0001594976,0.00002771025,0.00003798548],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003385526,"about_ca_system_score_gemma":0.00004385196,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001013125,"about_ca_topic_score_gemma":0.00003923231,"domain_scores_codex":[0.9979427,0.0003534178,0.0005059591,0.0002189191,0.0008792474,0.00009971673],"domain_scores_gemma":[0.9983523,0.0006290724,0.0002561698,0.0003531287,0.00036211,0.00004715377],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0000773596,0.0001669765,0.00009034558,0.00001207911,0.00002237809,1.311039e-7,0.001737251,0.537115,0.00003093907,0.2617287,0.1050372,0.09398165],"study_design_scores_gemma":[0.001258927,0.0001134211,0.0008250686,0.0000109758,0.00003181312,6.501367e-7,0.003495441,0.6740208,0.0007358704,0.1964271,0.1229755,0.0001043567],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.007902252,0.00001849974,0.9836079,0.002387953,0.000499522,0.0005973406,0.00001080383,0.00001987778,0.004955847],"genre_scores_gemma":[0.8412213,0.000001825492,0.1476417,0.0007436335,0.00003259993,0.0000504276,0.00003497472,0.000007825171,0.01026578],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8359662,"threshold_uncertainty_score":0.2338953,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2641596666964932,"score_gpt":0.4911128465630769,"score_spread":0.2269531798665838,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}