{"id":"W2950930770","doi":"10.48550/arxiv.cs/0211018","title":"Indexing schemes for similarity search: an illustrated paradigm","year":2002,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Management and Algorithms","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa","funders":"Marsden Fund; Fonterra Co-Operative Group; Natural Sciences and Engineering Research Council of Canada; Royal Society Te Apārangi; Royal Society; University of Ottawa","keywords":"Search engine indexing; Similarity (geometry); Nearest neighbor search; Metric (unit); Measure (data warehouse); Similarity measure; Computer science; Variety (cybernetics); Index (typography); Data mining; Information retrieval; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0004341501,0.0003283094,0.0003055804,0.0003080886,0.0002660889,0.0004791511,0.003047523,0.000257855,0.00005179291],"category_scores_gemma":[0.00002232369,0.0003917101,0.0001698723,0.0005842494,0.0001121146,0.001404621,0.002368596,0.0005344357,0.00004043137],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00009665718,"about_ca_system_score_gemma":0.000101953,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008080385,"about_ca_topic_score_gemma":0.00003003905,"domain_scores_codex":[0.9976408,0.0001074506,0.0001894275,0.001356061,0.0001270041,0.0005791854],"domain_scores_gemma":[0.9978692,0.00006949184,0.0001509509,0.001553251,0.0001172193,0.0002398792],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003137749,0.0003593848,0.0012051,0.0002731986,0.0002401141,0.0003697826,0.000300363,0.06359143,0.000009658929,0.9208686,0.001799838,0.0109512],"study_design_scores_gemma":[0.0005145413,0.00007171751,0.0002610373,0.00004254745,0.00004077067,0.000001109837,0.00004998708,0.9558735,0.00007420187,0.029285,0.01329028,0.000495292],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03547226,0.00003098433,0.9602913,0.0002014284,0.0004362449,0.0005720048,0.00009629675,0.0004329387,0.002466561],"genre_scores_gemma":[0.9822217,0.0001170865,0.01368505,0.0001342952,0.0001470088,0.000002300028,0.0002031694,0.00002316191,0.003466283],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9467494,"threshold_uncertainty_score":0.9998535,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2419410930848392,"score_gpt":0.2253713893522944,"score_spread":0.01656970373254479,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}