{"id":"W4393829228","doi":"10.5281/zenodo.8200679","title":"OpenAlex Author Name Disambiguation V3 Data - Disambiguation Model","year":2023,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"OpenAlex","funders":"","keywords":"Computer science; Natural language processing; Artificial intelligence; Information retrieval; Linguistics; Philosophy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.002440143,0.003319819,0.001403232,0.003666662,0.001383395,0.00234666,0.003784878,0.002501348,0.05002132],"category_scores_gemma":[0.00707018,0.0009885521,0.002571163,0.003808466,0.0008538109,0.002032091,0.003269677,0.002826814,0.107501],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002423212,"about_ca_system_score_gemma":0.003366083,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01364613,"about_ca_topic_score_gemma":0.02981425,"domain_scores_codex":[0.9979557,0.000315068,0.0002370453,0.0008312962,0.0004170815,0.0002437352],"domain_scores_gemma":[0.9974709,0.0005777464,0.0001678962,0.000967713,0.0006588595,0.000156967],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001952278,0.00006908865,0.001542935,0.0005823674,0.00004922254,0.00006888667,0.00005930309,0.001412748,0.0006024074,0.0009949112,0.9835693,0.01085358],"study_design_scores_gemma":[0.0002870209,0.00005677074,0.002872804,0.0001904897,0.00005191211,0.0002079263,0.0001663167,0.004997231,0.003631576,0.003569098,0.983889,0.00008000882],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.001494589,0.0002155289,0.00277442,0.0002271663,0.0001763824,0.0001777151,0.9775429,0.01481327,0.002578154],"genre_scores_gemma":[0.001904805,0.00005184993,0.006161306,0.0001410139,0.00001500105,0.0003009558,0.989223,0.0006388047,0.001563263],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.9975598,"threshold_uncertainty_score":0.167338,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4820321125774946,"score_gpt":0.4447693692728105,"score_spread":0.03726274330468415,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}