{"id":"W4391018115","doi":"10.1145/3593579","title":"Record Fusion via Inference and Data Augmentation","year":2024,"lang":"en","type":"article","venue":"ACM / IMS Journal of Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Inference; Probabilistic logic; Sensor fusion; Data mining; Fusion; Data source; Artificial intelligence; Machine learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","scholarly_communication","open_science"],"consensus_categories":["scholarly_communication","open_science"],"category_scores_codex":[0.0230291,0.00009981575,0.0001850018,0.0005237894,0.000249898,0.00214825,0.01304588,0.00002441266,0.0002198637],"category_scores_gemma":[0.01306571,0.00006603693,0.00001840937,0.001635967,0.0004944185,0.02037269,0.01114101,0.0001980731,0.0001362284],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003375756,"about_ca_system_score_gemma":0.000323502,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007799401,"about_ca_topic_score_gemma":0.00009017748,"domain_scores_codex":[0.9956779,0.0001325495,0.0008170487,0.0007800813,0.002371719,0.0002207299],"domain_scores_gemma":[0.9937635,0.00141623,0.0003919466,0.003944189,0.0002885344,0.000195585],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00001504592,0.00002463992,0.0007443671,0.00001081212,0.000008265724,0.00003455937,0.0002430792,0.000003262378,0.003531923,0.00120521,0.03558777,0.958591],"study_design_scores_gemma":[0.0005946493,0.0004309118,0.02515035,0.0004010677,0.0001107794,0.0003367279,0.002994877,0.0630696,0.0007013286,0.1132963,0.7924813,0.0004321366],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.324418,0.002927784,0.638906,0.02314301,0.007065012,0.0003896944,0.001602311,0.00006096902,0.001487274],"genre_scores_gemma":[0.9360951,0.001623674,0.06111645,0.0005506846,0.0002356469,5.995909e-7,0.0001207058,0.000006784798,0.0002503445],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9581589,"threshold_uncertainty_score":0.9988876,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5120775299749007,"score_gpt":0.5555716160536497,"score_spread":0.04349408607874894,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}