{"id":"W2115008552","doi":"10.5539/mas.v4n9p142","title":"Entropy Based Measurement of Text Dissimilarity for Duplicate – Detection","year":2010,"lang":"en","type":"article","venue":"Modern Applied Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Computer science; Similarity (geometry); Entropy (arrow of time); Data mining; Pattern recognition (psychology); Artificial intelligence; Physics; Image (mathematics)","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01256268,0.0001190349,0.0002023556,0.0002541596,0.0004010502,0.0002563663,0.001638537,0.00004722738,0.00007083362],"category_scores_gemma":[0.001484788,0.00009104715,0.00007635327,0.0008081321,0.0006142136,0.0002931279,0.0002421777,0.0001252441,0.00004242536],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004971694,"about_ca_system_score_gemma":0.0001566179,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002198416,"about_ca_topic_score_gemma":0.0002190539,"domain_scores_codex":[0.9956409,0.00002750074,0.0004855783,0.0007462484,0.002761871,0.0003378907],"domain_scores_gemma":[0.9977571,0.0002214726,0.0002686829,0.001123465,0.0004818002,0.0001474368],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.00004895011,0.00009001233,0.00004573429,0.000007671457,0.000002024217,7.102737e-8,0.0000821832,0.0001184538,0.8594804,0.02120177,0.0002234815,0.1186992],"study_design_scores_gemma":[0.0005744002,0.00005287872,0.005762964,0.000003786658,0.0000137024,2.955922e-7,0.000100181,0.2941508,0.5399874,0.1361955,0.02296813,0.0001899551],"study_design_candidate":"bench_or_experimental","study_design_consensus":"bench_or_experimental","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04392761,0.000003220485,0.95121,0.000660462,0.0003331129,0.000626922,0.00003423583,0.00003735025,0.003167093],"genre_scores_gemma":[0.9909896,3.951004e-7,0.008554999,0.000252715,0.00002927269,0.0001003814,0.000001835422,0.000005512746,0.00006523637],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.947062,"threshold_uncertainty_score":0.4354,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1460390288590918,"score_gpt":0.3735185434045063,"score_spread":0.2274795145454145,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}