{"id":"W4384405916","doi":"10.1145/3606699","title":"Comparing Heuristic Rules and Masked Language Models for Entity Alignment in the Literature Domain","year":2023,"lang":"en","type":"article","venue":"Journal on Computing and Cultural Heritage","topic":"Semantic Web and Ontologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Polytechnique Montréal","funders":"","keywords":"Heuristics; Computer science; Heuristic; Variety (cybernetics); Identifier; Metadata; Set (abstract data type); Preprocessor; Domain (mathematical analysis); Information retrieval; Tree (set theory); Natural language processing; Data science; Data mining; Artificial intelligence; World Wide Web; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.01128349,0.001537357,0.001344943,0.0041369,0.001167942,0.003723691,0.002236444,0.001997672,0.00214214],"category_scores_gemma":[0.03805064,0.0007680291,0.00176372,0.002965567,0.0009658199,0.005894907,0.001759481,0.002097905,0.001644292],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002111026,"about_ca_system_score_gemma":0.004028764,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01618692,"about_ca_topic_score_gemma":0.01926956,"domain_scores_codex":[0.9914971,0.004507533,0.000951298,0.001645291,0.001008508,0.0003901249],"domain_scores_gemma":[0.9579043,0.03487202,0.001501124,0.00262846,0.002554375,0.0005398021],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002701479,0.001096757,0.02300737,0.0008427448,0.0008797763,0.0005397022,0.001303906,0.475682,0.004710217,0.02086736,0.01151802,0.4568506],"study_design_scores_gemma":[0.00006256401,0.0001540229,0.001347578,0.00005104062,0.00008200045,0.0001223837,0.000261091,0.9766815,0.002664929,0.01674758,0.001772563,0.00005282652],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3064053,0.00251701,0.6708093,0.001832811,0.0004329494,0.0006146883,0.003300823,0.008720196,0.005367023],"genre_scores_gemma":[0.6663339,0.0006252566,0.3224881,0.0007117049,0.0001193348,0.000468832,0.007101311,0.0004675784,0.001683996],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9958631,"threshold_uncertainty_score":0.05967349,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03274933385203833,"score_gpt":0.2888449563192416,"score_spread":0.2560956224672032,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}