{"id":"W4404088722","doi":"10.48550/arxiv.2410.15516","title":"Generating Tabular Data Using Heterogeneous Sequential Feature Forest Flow Matching","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Time Series Analysis and Forecasting","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Institut de Valorisation des Données","keywords":"Matching (statistics); Feature (linguistics); Computer science; Feature matching; Flow (mathematics); Data mining; Artificial intelligence; Mathematics; Feature extraction; Statistics","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","open_science"],"consensus_categories":[],"category_scores_codex":[0.0003879279,0.0004616592,0.0004707015,0.0002748841,0.0004343806,0.0009917222,0.003419049,0.0003390807,0.00002894519],"category_scores_gemma":[0.0000204548,0.0005045754,0.0003202527,0.0006793112,0.00006738977,0.00055127,0.01556043,0.001012762,0.00004183497],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002147082,"about_ca_system_score_gemma":0.0002482535,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000520277,"about_ca_topic_score_gemma":0.0004682638,"domain_scores_codex":[0.9969051,0.0001249854,0.0002862613,0.001986502,0.0001707217,0.0005264545],"domain_scores_gemma":[0.9967882,0.00003863703,0.0002924898,0.002594688,0.0001115058,0.0001744787],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000004830801,0.00001569132,0.00009407452,0.0001119082,0.0002629044,0.001334839,0.0001547605,0.9908734,0.000295194,0.005605372,0.0001447905,0.00110224],"study_design_scores_gemma":[0.0001070628,0.00001438041,0.000004292525,0.0002008872,0.000286898,0.00005270576,0.00004734942,0.9876503,0.0000678314,0.01065558,0.0004043245,0.0005083628],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3091592,0.0005031455,0.6887181,0.00006189122,0.0009212286,0.0001423183,0.0000904004,0.0002494274,0.000154246],"genre_scores_gemma":[0.9285371,0.00004512504,0.07001865,0.00006201627,0.0005254667,2.960704e-7,0.0002036248,0.00004693293,0.0005607443],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.619378,"threshold_uncertainty_score":0.9997406,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1075741424326963,"score_gpt":0.2124400605726323,"score_spread":0.1048659181399359,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}