{"id":"W4417043196","doi":"10.2139/ssrn.5682046","title":"Meaning Under Shift: Benchmarking Novelty Metrics for Generalization-per-Joule","year":2025,"lang":"","type":"preprint","venue":"SSRN Electronic Journal","topic":"Action Observation and Synchronization","field":"Psychology","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Benchmarking; Novelty; Robustness (evolution); Novelty detection; Universality (dynamical systems); Subspace topology; Categorical variable","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01274925,0.001519333,0.001807198,0.003839763,0.001026957,0.00296499,0.002210169,0.002899152,0.002992762],"category_scores_gemma":[0.06721926,0.0003482527,0.001465187,0.002406614,0.002013657,0.007237018,0.00493328,0.002388922,0.0008886949],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001249529,"about_ca_system_score_gemma":0.001309765,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001382384,"about_ca_topic_score_gemma":0.001883371,"domain_scores_codex":[0.9938927,0.001927151,0.0005725347,0.001595202,0.001630811,0.0003816745],"domain_scores_gemma":[0.9658397,0.02024042,0.002259333,0.006265789,0.003741977,0.001652795],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003100748,0.000632351,0.05212336,0.001368349,0.001178073,0.0002630017,0.001636004,0.2188852,0.01269134,0.08019484,0.01384237,0.6140843],"study_design_scores_gemma":[0.0001216091,0.001352032,0.01869868,0.0001315854,0.0001755361,0.0002511973,0.0004119019,0.7889943,0.006244881,0.1797152,0.003760208,0.0001428501],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2497973,0.002710216,0.7339348,0.0008389254,0.000642894,0.0002236911,0.002070306,0.004136753,0.005645112],"genre_scores_gemma":[0.844251,0.0004295768,0.1486762,0.0001572312,0.000335416,0.0002618156,0.003243749,0.000994185,0.001650862],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9872507,"threshold_uncertainty_score":0.06742531,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04067389208170349,"score_gpt":0.3366062969751314,"score_spread":0.2959324048934279,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}