{"id":"W3129054449","doi":"10.6180/jase.202106_24(3).0009","title":"Text Representation and Similarity Measure for Text Clustering Based on Semantic Strings: A Case Study on Uyghur Language","year":2021,"lang":"en","type":"article","venue":"Journal of Applied Science and Engineering","topic":"Advanced Computational Techniques and Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University","funders":"","keywords":"Computer science; Natural language processing; Artificial intelligence; Cluster analysis; Explicit semantic analysis; Text graph; String metric; Semantic similarity; String (physics); Text processing; Noisy text analytics; Word (group theory); Set (abstract data type); Representation (politics); Similarity (geometry); Language model; Information retrieval; String searching algorithm; Semantic computing; Text mining; Linguistics; Mathematics; Pattern matching; Semantic technology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007922582,0.0004362547,0.0005381525,0.002634083,0.00158273,0.0009708539,0.0007821714,0.0007357341,0.001437551],"category_scores_gemma":[0.003602215,0.00009785396,0.00047648,0.004273994,0.0006476232,0.001233862,0.000639313,0.0003195123,0.0004032708],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009889257,"about_ca_system_score_gemma":0.000697887,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01073086,"about_ca_topic_score_gemma":0.00931332,"domain_scores_codex":[0.9989986,0.0003851491,0.0001018125,0.000205175,0.0002422105,0.00006709324],"domain_scores_gemma":[0.9979779,0.001146276,0.0001831133,0.0001750867,0.0004387996,0.00007890649],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001915921,0.001009153,0.03140064,0.001473522,0.0002061,0.01096331,0.008102701,0.08795869,0.05873331,0.01781494,0.01256808,0.7678537],"study_design_scores_gemma":[0.0001634043,0.0007487477,0.05199936,0.0001226843,0.0002408833,0.002979409,0.01242447,0.8345676,0.06078839,0.01240144,0.02337904,0.0001845781],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.914395,0.0005543915,0.07995169,0.0004461671,0.00005468668,0.0002669211,0.0006689556,0.000608809,0.003053323],"genre_scores_gemma":[0.8930902,0.0002257507,0.1032412,0.00005408038,0.00002767002,0.0001556708,0.001047184,0.00006128952,0.002097025],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.01073086,"threshold_uncertainty_score":0.02133679,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02359091826546359,"score_gpt":0.3016794827715407,"score_spread":0.2780885645060771,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}