{"id":"W2963381796","doi":"","title":"Text Categorization via Similarity Search - An Efficient and Effective Novel Algorithm.","year":2013,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; Similarity (geometry); Artificial intelligence; Centroid; Cluster analysis; Preprocessor; Outlier; Metric (unit); Categorization; Text categorization; Point (geometry); Class (philosophy); Similarity measure; Pattern recognition (psychology); Algorithm; Mathematics; Image (mathematics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0001799395,0.000103613,0.00009162618,0.0001222079,0.0001486198,0.0003111558,0.000417194,0.00007794105,0.0000405688],"category_scores_gemma":[0.00002214111,0.00008290616,0.00001613984,0.0003456476,0.00008586613,0.0006579751,0.0002496176,0.0001052409,0.00009381462],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002836293,"about_ca_system_score_gemma":0.00001774336,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002182743,"about_ca_topic_score_gemma":0.00000299837,"domain_scores_codex":[0.9990711,0.00003457655,0.0001226659,0.0003743971,0.0001992602,0.0001979757],"domain_scores_gemma":[0.9992793,0.00006751779,0.00003483809,0.0004120806,0.0001288637,0.00007744841],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[7.498363e-7,0.0001778967,0.0005990473,0.000006102448,0.000006754795,3.859541e-7,0.0003713691,0.0001350254,0.009223146,0.1359031,0.0001403235,0.8534361],"study_design_scores_gemma":[0.0002455498,0.0001238693,0.05175988,0.000001933422,0.000001950973,0.00000422531,0.0001249536,0.9173972,0.02616307,0.003782525,0.0002437847,0.0001510375],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04125173,0.00001612628,0.9554493,0.00133224,0.00007671833,0.0004592275,8.17052e-7,0.0005502279,0.0008636164],"genre_scores_gemma":[0.8953956,0.000004230875,0.1042118,0.000108441,0.00001329675,0.00006577409,0.000004114573,0.000004589062,0.0001921962],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9172622,"threshold_uncertainty_score":0.3380815,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01306940863528285,"score_gpt":0.2493323822246399,"score_spread":0.2362629735893571,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}