{"id":"W2374445525","doi":"","title":"Calculation of the Text Similarity Based on Text Categorization","year":2008,"lang":"en","type":"article","venue":"Microcomputer applications","topic":"Advanced Computational Techniques and Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Categorization; Similarity (geometry); Computer science; Text categorization; Natural language processing; Information retrieval; Value (mathematics); Feature (linguistics); Artificial intelligence; Content (measure theory); Linguistics; Machine learning; Mathematics; Image (mathematics)","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00007943645,0.0001479302,0.0001316205,0.000104219,0.0004552248,0.00002831498,0.0009706423,0.00006805594,0.000004155964],"category_scores_gemma":[0.000001693495,0.0001226676,0.0001120241,0.001008622,0.0001031164,0.000154231,0.0001689088,0.0001408968,0.00002723186],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00006674194,"about_ca_system_score_gemma":0.0001092473,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001006194,"about_ca_topic_score_gemma":0.000001343841,"domain_scores_codex":[0.9987989,0.00004335965,0.0003276998,0.0003986501,0.0002709965,0.0001603768],"domain_scores_gemma":[0.998593,0.0001204303,0.0002100292,0.0007978475,0.000226639,0.00005208949],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000006039603,0.0007808544,0.001492978,0.00003280734,0.00001856042,8.466216e-7,0.0003529222,0.1828152,0.01022675,0.6463318,0.005325217,0.152616],"study_design_scores_gemma":[0.0004403635,0.00005710956,0.03132762,0.00002922664,0.00001149175,0.00002650665,0.000002540107,0.6603692,0.03676308,0.03788267,0.2327138,0.0003763924],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.001035797,0.00001829482,0.9942558,0.002770798,0.00001705258,0.0008223616,0.000009777544,0.0002096655,0.0008604632],"genre_scores_gemma":[0.5855299,0.000005975206,0.4131323,0.0008330441,0.00005278837,0.0003330494,0.00002104867,0.00001058067,0.00008132563],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.6084492,"threshold_uncertainty_score":0.500224,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01439492139402742,"score_gpt":0.2509776030207222,"score_spread":0.2365826816266948,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}