{"id":"W4416063095","doi":"10.48550/arxiv.2507.06806","title":"GreenHyperSpectra: A multi-source hyperspectral dataset for global vegetation trait prediction","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Remote Sensing in Agriculture","field":"Environmental Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Simon Fraser University; McGill University; Mila - Quebec Artificial Intelligence Institute","funders":"","keywords":"Hyperspectral imaging; Trait; Leverage (statistics); Regression; Predictive modelling; Pairwise comparison; Sampling (signal processing); Feature learning; Representation (politics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0002272595,0.0004534694,0.0003703551,0.00003837767,0.0002178453,0.00007437911,0.0005748725,0.0005196538,0.00006174966],"category_scores_gemma":[0.0001440607,0.000410654,0.0002408029,0.0002769715,0.0001863852,0.0001750767,0.0004971484,0.0005609971,0.0001556783],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0011044,"about_ca_system_score_gemma":0.00005389483,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0009226255,"about_ca_topic_score_gemma":0.001164664,"domain_scores_codex":[0.9974481,0.00008883041,0.0004137893,0.00116673,0.0003918683,0.0004906446],"domain_scores_gemma":[0.9988329,0.00005682407,0.0002339661,0.0006985378,0.00003363759,0.0001440694],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003628656,0.001557822,0.5959609,0.0009144098,0.0008433548,0.00005927383,0.004091841,0.1515236,0.03511471,0.0002602602,0.1821119,0.02719906],"study_design_scores_gemma":[0.001114815,0.0001064359,0.9450865,0.0001997369,0.0003343042,0.00003364567,0.0002276669,0.02233158,0.001127548,0.0004107292,0.02837137,0.0006556587],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9572708,0.0002613889,0.02511525,0.001520426,0.001833648,0.002211087,0.00761351,0.0003847847,0.003789101],"genre_scores_gemma":[0.9320341,0.00008646265,0.05032893,0.0008569279,0.0008242159,0.00006809229,0.01258905,0.00005232312,0.003159883],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3491257,"threshold_uncertainty_score":0.9998345,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03092626688485142,"score_gpt":0.2730402119572701,"score_spread":0.2421139450724187,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}