{"id":"W6891643041","doi":"10.48448/se5p-7p38","title":"Long-form evaluation of model editing","year":2024,"lang":"en","type":"other","venue":"Underline Science Inc.","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Software portability; Generative grammar; Protocol (science); Classifier (UML); Language model; Set (abstract data type); Natural language; Protocol analysis","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03019853,0.001386836,0.0007740603,0.002037045,0.0008485815,0.00293152,0.001823762,0.001937377,0.004353719],"category_scores_gemma":[0.2220221,0.0004048609,0.0007751498,0.001518998,0.001397526,0.004860532,0.003418915,0.002707686,0.001768162],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001133641,"about_ca_system_score_gemma":0.001126234,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001623736,"about_ca_topic_score_gemma":0.002737603,"domain_scores_codex":[0.9555243,0.02562959,0.003558808,0.004243875,0.01019889,0.0008444912],"domain_scores_gemma":[0.7305454,0.177986,0.0142773,0.04587931,0.0276002,0.003711687],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.004455926,0.004097932,0.06398186,0.003762613,0.0008672041,0.0005862228,0.009122426,0.09057616,0.03740553,0.01773657,0.04594591,0.7214617],"study_design_scores_gemma":[0.0008867315,0.00917874,0.09669114,0.001025032,0.0004371421,0.001378015,0.004277478,0.6777477,0.09057193,0.03941134,0.07772342,0.0006713418],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6554561,0.001821787,0.2900394,0.001178968,0.000584199,0.002861201,0.005295421,0.01221995,0.03054303],"genre_scores_gemma":[0.8468936,0.0002681369,0.1359321,0.0004688957,0.0001243303,0.001704698,0.007503862,0.001421871,0.005682353],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03019853,"threshold_uncertainty_score":0.159707,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09369404228987084,"score_gpt":0.3853238918115702,"score_spread":0.2916298495216994,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}