{"id":"W4312925950","doi":"10.2196/39077","title":"German Medical Named Entity Recognition Model and Data Set Creation Using Machine Translation and Word Alignment: Algorithm Development and Validation","year":2022,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Topic Modeling","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Bundesministerium für Bildung und Forschung","keywords":"Computer science; Test set; Artificial intelligence; Machine translation; Natural language processing; Named-entity recognition; Set (abstract data type); Data set; Test data; German; Annotation; Data mining; Information retrieval; Programming language","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004840751,0.001418153,0.0006957667,0.001854805,0.0007788754,0.00127926,0.002173429,0.001610734,0.00340179],"category_scores_gemma":[0.01046802,0.0004492463,0.001407216,0.001494667,0.0006378094,0.001810444,0.001839642,0.001974176,0.002335816],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001783328,"about_ca_system_score_gemma":0.00209375,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0156668,"about_ca_topic_score_gemma":0.01457876,"domain_scores_codex":[0.9978461,0.0007472348,0.0002486711,0.000652845,0.0003748364,0.0001302638],"domain_scores_gemma":[0.9965328,0.001634473,0.0002181426,0.0006570451,0.0008503898,0.0001072258],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009265309,0.0008789087,0.0135475,0.0008706579,0.0005722202,0.001049216,0.0003515538,0.5489358,0.008765871,0.007964456,0.03265554,0.3834817],"study_design_scores_gemma":[0.00007510697,0.0001350771,0.002342541,0.00005612119,0.00004134409,0.0001831646,0.0001022656,0.9780573,0.01071395,0.00316023,0.005099528,0.00003340221],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.2648811,0.001679797,0.6872306,0.0017689,0.0004924258,0.001733871,0.01465609,0.02177311,0.005784095],"genre_scores_gemma":[0.4451727,0.0006368379,0.4958836,0.0004489455,0.00008267788,0.00182671,0.05156793,0.0005485035,0.003832152],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.0156668,"threshold_uncertainty_score":0.03115118,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2205561870171737,"score_gpt":0.4362133696296889,"score_spread":0.2156571826125152,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}