{"id":"W3127229356","doi":"10.1016/j.dib.2021.106814","title":"Patent relatedness and velocity in the Chinese pharmaceutical industry: A dataset of Jaccard similarity indices","year":2021,"lang":"en","type":"article","venue":"Data in Brief","topic":"Intellectual Property and Patents","field":"Business, Management and Accounting","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"HEC Montréal; Center for Interuniversity Research and Analysis on Organizations","funders":"","keywords":"Jaccard index; Similarity (geometry); China; Proxy (statistics); Data mining; Computer science; Pharmaceutical industry; Index (typography); Statistics; Information retrieval; Mathematics; Geography; Artificial intelligence; Pattern recognition (psychology); World Wide Web; Biology; Biotechnology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.001061551,0.0009365697,0.00102058,0.01359523,0.0008604287,0.001324564,0.001307859,0.001128354,0.003909535],"category_scores_gemma":[0.005784098,0.0002123509,0.0008107009,0.01916644,0.0005011762,0.001404317,0.001207273,0.0005109763,0.002450192],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002355901,"about_ca_system_score_gemma":0.003119682,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.05315712,"about_ca_topic_score_gemma":0.05058146,"domain_scores_codex":[0.9983674,0.0001517087,0.0003003647,0.0003832978,0.000554782,0.0002425332],"domain_scores_gemma":[0.9969248,0.0006640409,0.0005780346,0.0004609807,0.000940007,0.0004320473],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0008077796,0.001009312,0.5432862,0.002673132,0.0005674993,0.001690889,0.001385732,0.009477013,0.004711907,0.006451759,0.2828553,0.1450835],"study_design_scores_gemma":[0.0001849342,0.0001830315,0.8739967,0.0001317551,0.0001571138,0.0003987522,0.0008377861,0.01545359,0.001709075,0.001999553,0.1048295,0.0001181609],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.4067578,0.0009822445,0.001304104,0.0002862262,0.00008029873,0.0002191918,0.5842649,0.0005020169,0.005603184],"genre_scores_gemma":[0.2342128,0.0003674735,0.002425813,0.00004580171,0.00005752804,0.0003117335,0.7611161,0.00002931365,0.001433339],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.9864048,"threshold_uncertainty_score":0.1056954,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2641637311920987,"score_gpt":0.319856200011215,"score_spread":0.05569246881911627,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}