{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":2,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":2,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"9629b59d971d","filters":{"venue":"ACM / IMS Journal of Data Science"}},"results":[{"id":"W4391131725","doi":"10.1145/3594234","title":"Optimistic Rates: A Unifying Theory for Interpolation Learning and Regularization in Linear Regression","year":2024,"lang":"en","type":"article","venue":"ACM / IMS Journal of Data Science","topic":"Sparse and Compressive Sensing Techniques","field":"Engineering","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Regularization (linguistics); Linear regression; Mathematics; Interpolation (computer graphics); Econometrics; Applied mathematics; Linear interpolation; Bayesian multivariate linear regression; Regression; Proper linear model; Statistics; Linear model; Computer science; Artificial intelligence; Mathematical analysis","authors":[{"name":"Lijia Zhou","is_ca":false},{"name":"Frederic Koehler","is_ca":false},{"name":"Danica J. Sutherland","is_ca":true},{"name":"Nathan Srebro","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0531062436633936,"gpt":0.3582758260044411,"spread":0.3051695823410475,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001276625,0.00005625731,0.00008063069,0.0002458734,0.00006015886,0.0001262387,0.0003726121,0.00002720467,0.000001959795],"category_scores_gemma":[0.001034066,0.00004417032,0.00001029621,0.0003007276,0.00007057285,0.001243673,0.0001493821,0.000178854,2.760326e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002738729,"about_ca_system_score_gemma":0.00004170013,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":7.651948e-7,"about_ca_topic_score_gemma":4.709004e-7,"domain_scores_codex":[0.9994588,0.00002450257,0.0001814929,0.000118597,0.0001204501,0.00009615251],"domain_scores_gemma":[0.9994557,0.0002151637,0.00004978144,0.0001817175,0.00006804064,0.00002954167],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009438414,0.00002200778,0.001497988,0.0002295072,0.00003615252,0.00008086873,0.002174352,0.02990863,0.6592494,0.004888512,0.0008161146,0.3010021],"study_design_scores_gemma":[0.00008700705,0.00006058814,0.0001480287,0.001268158,0.00001177649,0.00007062838,0.0001786055,0.9802243,0.0102575,0.007019254,0.0006064164,0.00006772687],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1107681,0.002335303,0.8861553,0.00008501465,0.0003854414,0.00008699364,0.000004145629,0.00008454073,0.00009515696],"genre_scores_gemma":[0.9222077,0.0003403445,0.07735966,0.000005483902,0.00005594988,4.544386e-7,0.000005835371,0.000008355361,0.0000161962],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9503157,"threshold_uncertainty_score":0.1801213,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4391018115","doi":"10.1145/3593579","title":"Record Fusion via Inference and Data Augmentation","year":2024,"lang":"en","type":"article","venue":"ACM / IMS Journal of Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Inference; Probabilistic logic; Sensor fusion; Data mining; Fusion; Data source; Artificial intelligence; Machine learning","authors":[{"name":"Alireza Heidari","is_ca":true},{"name":"Ihab F. Ilyas","is_ca":true},{"name":"Theodoros Rekatsinas","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5120775299749007,"gpt":0.5555716160536497,"spread":0.04349408607874894,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","scholarly_communication","open_science"],"consensus_categories":["scholarly_communication","open_science"],"category_scores_codex":[0.0230291,0.00009981575,0.0001850018,0.0005237894,0.000249898,0.00214825,0.01304588,0.00002441266,0.0002198637],"category_scores_gemma":[0.01306571,0.00006603693,0.00001840937,0.001635967,0.0004944185,0.02037269,0.01114101,0.0001980731,0.0001362284],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003375756,"about_ca_system_score_gemma":0.000323502,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007799401,"about_ca_topic_score_gemma":0.00009017748,"domain_scores_codex":[0.9956779,0.0001325495,0.0008170487,0.0007800813,0.002371719,0.0002207299],"domain_scores_gemma":[0.9937635,0.00141623,0.0003919466,0.003944189,0.0002885344,0.000195585],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00001504592,0.00002463992,0.0007443671,0.00001081212,0.000008265724,0.00003455937,0.0002430792,0.000003262378,0.003531923,0.00120521,0.03558777,0.958591],"study_design_scores_gemma":[0.0005946493,0.0004309118,0.02515035,0.0004010677,0.0001107794,0.0003367279,0.002994877,0.0630696,0.0007013286,0.1132963,0.7924813,0.0004321366],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.324418,0.002927784,0.638906,0.02314301,0.007065012,0.0003896944,0.001602311,0.00006096902,0.001487274],"genre_scores_gemma":[0.9360951,0.001623674,0.06111645,0.0005506846,0.0002356469,5.995909e-7,0.0001207058,0.000006784798,0.0002503445],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9581589,"threshold_uncertainty_score":0.9988876,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}