{"id":"W2404580422","doi":"","title":"Benchmarks for Enterprise Linking: Thomson Reuters R&D at TAC 2013.","year":2013,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Benchmark (surveying); Task (project management); Computer science; Domain (mathematical analysis); Named-entity recognition; Entity linking; Information retrieval; Artificial intelligence; Mathematics; Knowledge base; Management","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002573201,0.00009703112,0.0001829987,0.000105215,0.0002493944,0.0001378478,0.0005501721,0.00004657101,0.0004941479],"category_scores_gemma":[0.0002300591,0.00007242687,0.00005893184,0.0001994895,0.0003264344,0.00036578,0.00028144,0.00004278188,0.00009700216],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00000989335,"about_ca_system_score_gemma":0.00001249563,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00003048096,"about_ca_topic_score_gemma":0.00001462355,"domain_scores_codex":[0.9987828,0.0001241305,0.0004023006,0.0002947283,0.0002526987,0.0001433177],"domain_scores_gemma":[0.9972996,0.0015737,0.0002137822,0.0006660011,0.0001821893,0.00006479405],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00004845955,0.0000421499,0.0001994143,0.00002620481,0.00001573217,3.334297e-8,0.0007093587,0.000005421995,0.0002651409,0.9002951,0.02895741,0.06943559],"study_design_scores_gemma":[0.0001082714,0.00002541163,0.0003680891,0.000004204585,0.00001411531,4.881136e-7,0.001892265,0.00003266939,0.001257109,0.6684585,0.3277718,0.00006703791],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1042657,0.001132389,0.8600539,0.005829807,0.0002121004,0.002834209,0.0002668769,0.0000713235,0.02533372],"genre_scores_gemma":[0.9876438,0.0001748559,0.002110907,0.0003379868,0.00007384282,0.0008718205,0.0001600905,0.00000759518,0.008619124],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8833781,"threshold_uncertainty_score":0.5410573,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03887689956804048,"score_gpt":0.3441753447018895,"score_spread":0.305298445133849,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}