{"id":"W2070292114","doi":"10.1002/ev.393","title":"Internal evaluation, historically speaking","year":2011,"lang":"en","type":"article","venue":"New Directions for Evaluation","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":20,"is_retracted":false,"has_abstract":true,"ca_institutions":"Centre for Advancing Health Outcomes; University of British Columbia","funders":"","keywords":"Context (archaeology); Conservatism; Speculation; Government (linguistics); Function (biology); Evaluation methods; Internal validity; Political science; Public administration; Sociology; Public relations; Law; Business; History","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.02384737,0.0006609487,0.0007017195,0.004428807,0.003039782,0.01359882,0.001118431,0.001252656,0.004834597],"category_scores_gemma":[0.04598076,0.0002663316,0.0004646526,0.003956595,0.01508999,0.006884928,0.00503629,0.002636632,0.0009644075],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01294272,"about_ca_system_score_gemma":0.009247742,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003514384,"about_ca_topic_score_gemma":0.00288354,"domain_scores_codex":[0.9694826,0.01654276,0.001715231,0.002024217,0.009029339,0.001205939],"domain_scores_gemma":[0.9543013,0.0184663,0.004126866,0.003221247,0.01851786,0.001366437],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00007345891,0.0001028194,0.005645331,0.0007370454,0.00002870709,0.0001204233,0.007165432,0.0008467087,0.000432552,0.6817874,0.02084003,0.2822201],"study_design_scores_gemma":[0.00005598283,0.0003247225,0.01880724,0.009207484,0.0001098496,0.0008572637,0.01723104,0.003523801,0.004679136,0.3831814,0.561885,0.0001371185],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.04296228,0.04430625,0.06992962,0.05119978,0.002611591,0.0003343757,0.0002332645,0.0003409967,0.7880818],"genre_scores_gemma":[0.9067696,0.01796104,0.0194126,0.005924142,0.001268406,0.000359186,0.0001827987,0.0002093843,0.04791286],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9761527,"threshold_uncertainty_score":0.1261185,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4596669989734262,"score_gpt":0.5336734648069541,"score_spread":0.07400646583352793,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}