{"id":"W4416016498","doi":"10.1145/3746252.3761322","title":"Enhancing and Assessing Instruction-Following with Fine-Grained Instruction Variants","year":2025,"lang":"","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Robustness (evolution); Construct (python library); Benchmark (surveying); Training set; Focus (optics); Software deployment; Sensitivity (control systems)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001812707,0.002142659,0.0009168049,0.001334948,0.0006064365,0.001543133,0.002470508,0.001340796,0.002320588],"category_scores_gemma":[0.01221661,0.0006689372,0.001242095,0.001245713,0.0009827993,0.003504209,0.001925813,0.002885425,0.002310466],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009686688,"about_ca_system_score_gemma":0.001819137,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008258961,"about_ca_topic_score_gemma":0.02167377,"domain_scores_codex":[0.9983204,0.0004419055,0.0001200848,0.00075037,0.0002416789,0.0001255664],"domain_scores_gemma":[0.9961699,0.00206039,0.0002008441,0.0009959592,0.0004266407,0.0001463176],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001436451,0.0007520833,0.04715854,0.001445578,0.0005504815,0.0004429102,0.001056865,0.2516358,0.04437197,0.004369725,0.04596348,0.6008161],"study_design_scores_gemma":[0.0001307589,0.0004631213,0.004988758,0.00007246094,0.0001571107,0.0002060762,0.0004110367,0.9370172,0.03187334,0.009012409,0.01557686,0.00009098646],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5192395,0.005192889,0.3686757,0.001282296,0.0006361645,0.0004827247,0.01376543,0.08405538,0.006669891],"genre_scores_gemma":[0.7303388,0.0006246116,0.222611,0.0009018951,0.0001081526,0.0005054772,0.03739438,0.003425497,0.00409034],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.008258961,"threshold_uncertainty_score":0.01642179,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01182237968810277,"score_gpt":0.2519153502437036,"score_spread":0.2400929705556008,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}