{"id":"W3127229356","doi":"10.1016/j.dib.2021.106814","title":"Patent relatedness and velocity in the Chinese pharmaceutical industry: A dataset of Jaccard similarity indices","year":2021,"lang":"en","type":"article","venue":"Data in Brief","topic":"Intellectual Property and Patents","field":"Business, Management and Accounting","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"HEC Montréal; Center for Interuniversity Research and Analysis on Organizations","funders":"","keywords":"Jaccard index; Similarity (geometry); China; Proxy (statistics); Data mining; Computer science; Pharmaceutical industry; Index (typography); Statistics; Information retrieval; Mathematics; Geography; Artificial intelligence; Pattern recognition (psychology); World Wide Web; Biology; Biotechnology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00103326,0.0001183346,0.0001850828,0.00008595656,0.00006482356,0.0001341824,0.0005862112,0.0001404887,0.0002382035],"category_scores_gemma":[0.000601119,0.00007966874,0.0000129045,0.0007351837,0.00009236136,0.0008956937,0.00100105,0.0006263848,0.00001821589],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000008288081,"about_ca_system_score_gemma":0.00002630974,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002808755,"about_ca_topic_score_gemma":0.0009375624,"domain_scores_codex":[0.9989287,0.00005990862,0.0002937349,0.0003114342,0.0002169785,0.0001892706],"domain_scores_gemma":[0.9992605,0.00009184873,0.00008451041,0.0005113821,0.00004228541,0.000009510028],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002501845,0.0006874854,0.9516863,0.0005059377,0.00005214355,0.0003949303,0.0006373994,0.00003158816,0.00009616603,0.0006086738,0.03464993,0.01039924],"study_design_scores_gemma":[0.002216549,0.00001238766,0.6775321,0.000230614,0.00008311339,0.00002575844,0.0008326497,0.02946287,0.0001005776,0.0009481639,0.2881797,0.0003755301],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9959006,0.0002398348,0.000007619007,0.00117706,0.0001309023,0.0001682614,0.001231779,0.0000088651,0.00113502],"genre_scores_gemma":[0.987707,0.00006867188,0.00002413867,0.003239653,0.0001123859,0.000005014537,0.008828904,0.000007115426,0.000007120778],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2741542,"threshold_uncertainty_score":0.4246017,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2641637311920987,"score_gpt":0.319856200011215,"score_spread":0.05569246881911627,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}