{"id":"W7083466133","doi":"10.5281/zenodo.17209747","title":"Zoran🦋 aSiM Benchmark: Empirical Validation of a Mimetic Intelligence Framework Across 2000+ Multidomain Questions","year":2025,"lang":"fr","type":"report","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Agriculture, Water, and Health","field":"Environmental Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Baseline (sea); Benchmark (surveying); Qualitative analysis; Empirical research","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008723491,0.001374817,0.0007916541,0.002482059,0.001161285,0.00303929,0.002418481,0.001924159,0.02379943],"category_scores_gemma":[0.06663699,0.0006129751,0.001059453,0.001768545,0.001183894,0.005533142,0.005432853,0.002366653,0.01328419],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001653055,"about_ca_system_score_gemma":0.001366739,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00551481,"about_ca_topic_score_gemma":0.005889806,"domain_scores_codex":[0.9910296,0.005414964,0.0007583005,0.00125712,0.001334487,0.0002054299],"domain_scores_gemma":[0.9654219,0.02369744,0.0009278037,0.004582251,0.004606451,0.0007640583],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.005506364,0.004519975,0.03384477,0.008144001,0.0009540158,0.0006087005,0.0114969,0.02476095,0.02524444,0.0189542,0.3014938,0.5644718],"study_design_scores_gemma":[0.005851061,0.005772158,0.1635541,0.001753423,0.0007603242,0.002096105,0.01259563,0.2574902,0.04329509,0.04150787,0.4646498,0.0006743099],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6829364,0.002753379,0.09992501,0.002066007,0.001064761,0.008602534,0.05820101,0.0341326,0.1103182],"genre_scores_gemma":[0.6398679,0.0004971867,0.154326,0.001379028,0.0002288515,0.01347045,0.1626044,0.003493407,0.02413277],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02379943,"threshold_uncertainty_score":0.07961696,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06040146508441012,"score_gpt":0.3355737193026329,"score_spread":0.2751722542182227,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}