{"id":"W7017672079","doi":"","title":"Benchmarking Foundation Evaluation Practices","year":2016,"lang":"en","type":"dataset","venue":"Issue Lab (Candid)","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Benchmarking; Foundation (evidence); Staffing; General partnership; Data collection; Best practice; Evaluation methods","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.05249061,0.001320332,0.00141418,0.01906753,0.002208849,0.007162026,0.003667731,0.001628487,0.02901777],"category_scores_gemma":[0.2102858,0.001035344,0.001930018,0.03645996,0.0009932611,0.006052193,0.006168898,0.002653173,0.0196455],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.007251187,"about_ca_system_score_gemma":0.01524001,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.03158741,"about_ca_topic_score_gemma":0.03391357,"domain_scores_codex":[0.9003928,0.04233933,0.02171287,0.01016024,0.02117662,0.004218141],"domain_scores_gemma":[0.8128706,0.04937163,0.02121798,0.05031816,0.06149407,0.00472762],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"observational","study_design_scores_codex":[0.0002532994,0.0001532516,0.03790557,0.002804877,0.0002712529,0.00006432506,0.000950216,0.001984132,0.0002400256,0.01717321,0.8238279,0.114372],"study_design_scores_gemma":[0.0001467797,0.00005091302,0.03328187,0.002663283,0.00007466783,0.0001017412,0.001036155,0.001268035,0.0007673759,0.004935776,0.9555857,0.0000877845],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.01821194,0.003900158,0.01705096,0.005214028,0.0005058582,0.002052333,0.8520601,0.003991362,0.09701319],"genre_scores_gemma":[0.04051789,0.001846592,0.02348549,0.000871137,0.0001090456,0.004714263,0.9161041,0.001338861,0.01101257],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.9475094,"threshold_uncertainty_score":0.2776002,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05451462902368857,"score_gpt":0.3848028726989512,"score_spread":0.3302882436752626,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}