{"id":"W4400522920","doi":"10.1162/dint_a_00255","title":"FAIR Enough: Develop and Assess a FAIR-Compliant Dataset for Large Language Model Training?","year":2024,"lang":"en","type":"article","venue":"Data Intelligence","topic":"Research Data Management Practices","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University; Toronto Metropolitan University; Vector Institute","funders":"Government of Canada; Canadian Institute for Advanced Research","keywords":"Stewardship (theology); Computer science; Context (archaeology); Interoperability; Frame (networking); Process (computing); Work (physics); Engineering ethics; Knowledge management; Process management; Accreditation; Checklist; Data science; Risk analysis (engineering); Political science; Business; Engineering; Psychology; World Wide Web; Medical education; Medicine","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.1842907,0.0009079298,0.0007970192,0.004353384,0.004923473,0.01249578,0.005655203,0.004005324,0.006338498],"category_scores_gemma":[0.4304295,0.001036318,0.00132817,0.003299801,0.006726117,0.01499865,0.0160698,0.005496948,0.002269391],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005808251,"about_ca_system_score_gemma":0.01697844,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005888816,"about_ca_topic_score_gemma":0.01071133,"domain_scores_codex":[0.8604078,0.0983826,0.01013816,0.007297061,0.02182547,0.001948868],"domain_scores_gemma":[0.5839685,0.1791221,0.02320201,0.1412716,0.06554587,0.006889969],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001830091,0.003171796,0.07965098,0.002656491,0.0004449229,0.001054304,0.04158372,0.03717316,0.01216149,0.2849522,0.1088825,0.4264384],"study_design_scores_gemma":[0.001138986,0.002312112,0.02753413,0.006944427,0.0002865581,0.000971043,0.02648216,0.1706358,0.05063511,0.340063,0.3722343,0.000762498],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1635467,0.0007113074,0.7613403,0.01836351,0.001079505,0.008098282,0.009038901,0.007946685,0.02987472],"genre_scores_gemma":[0.2352482,0.000173104,0.7423065,0.002181573,0.0000902631,0.005240022,0.01094596,0.001468894,0.002345552],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9943448,"threshold_uncertainty_score":0.9746342,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3962006214895893,"score_gpt":0.4654284737358328,"score_spread":0.0692278522462435,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}