{"id":"W1565635109","doi":"10.3390/rs70708489","title":"On the Importance of Training Data Sample Selection in Random Forest Image Classification: A Case Study in Peatland Ecosystem Mapping","year":2015,"lang":"en","type":"article","venue":"Remote Sensing","topic":"Remote Sensing and LiDAR Applications","field":"Environmental Science","cited_by":596,"is_retracted":false,"has_abstract":true,"ca_institutions":"Carleton University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Random forest; Computer science; Class (philosophy); Contextual image classification; Set (abstract data type); Data set; Spatial analysis; Artificial intelligence; Pattern recognition (psychology); Feature selection; Data mining; Remote sensing; Statistics; Image (mathematics); Mathematics; Geography","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02072121,0.0007680579,0.0008719188,0.0008366004,0.001257969,0.001274782,0.0007394747,0.001809859,0.0003109038],"category_scores_gemma":[0.07320975,0.0002422398,0.0006797849,0.001519717,0.001388997,0.001582782,0.0008310283,0.001256722,0.0001035573],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001013581,"about_ca_system_score_gemma":0.0007941694,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009803756,"about_ca_topic_score_gemma":0.01551733,"domain_scores_codex":[0.9902571,0.007281472,0.0003429038,0.0005698861,0.001293129,0.000255496],"domain_scores_gemma":[0.8564842,0.1321943,0.002360598,0.002788353,0.005815192,0.0003574106],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001651495,0.001478279,0.1521535,0.0006255625,0.0003535241,0.00211433,0.002136966,0.5081897,0.01355491,0.004375539,0.002703001,0.3106631],"study_design_scores_gemma":[0.0001065963,0.001072763,0.04991375,0.0001258961,0.0002325755,0.0009177256,0.001146511,0.9219025,0.01801987,0.004618792,0.001828954,0.0001139686],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.8948958,0.001339194,0.09950282,0.0009771234,0.00004300075,0.0002975238,0.0001018896,0.0001414649,0.002701201],"genre_scores_gemma":[0.9132607,0.0002887494,0.08545487,0.0001166735,0.00004300788,0.00008705039,0.0001125848,0.00006638544,0.0005700284],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.02072121,"threshold_uncertainty_score":0.1095855,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1119004036964485,"score_gpt":0.3030058956641651,"score_spread":0.1911054919677166,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}