{"id":"W2368095729","doi":"","title":"Web Page Text Information Extraction and Result Estimation","year":2007,"lang":"en","type":"article","venue":"Microcomputer applications","topic":"Web Data Mining and Analysis","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Computer science; Realization (probability); Construct (python library); Information retrieval; Noise (video); Quality (philosophy); Web page; Information extraction; Process (computing); Data mining; World Wide Web; Artificial intelligence; Statistics; Mathematics; Programming language","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004024139,0.0001015173,0.00009025636,0.0002409181,0.0002303661,0.0003163941,0.0003407964,0.00005797013,0.00000323949],"category_scores_gemma":[0.000002243963,0.0001026968,0.00003176424,0.0005269641,0.00002805949,0.001405614,0.0001370743,0.0001016344,0.000195096],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003347294,"about_ca_system_score_gemma":0.00002628156,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002013125,"about_ca_topic_score_gemma":0.000008138742,"domain_scores_codex":[0.9991345,0.00001513007,0.0003089092,0.0002374647,0.0001308647,0.0001731757],"domain_scores_gemma":[0.999244,0.00008488446,0.000133841,0.0003734098,0.0000844704,0.00007941214],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.000001486941,0.00002952447,0.00009968809,0.00001130545,0.000009879509,4.818429e-7,0.0003253467,0.00008319089,0.007310128,0.009227184,0.002455545,0.9804462],"study_design_scores_gemma":[0.0003852794,0.00002274187,0.007498964,0.0000165307,0.00002005041,0.00006088395,0.00005548103,0.3000976,0.003613926,0.001278684,0.6866828,0.0002670688],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.005209529,0.00004034049,0.9924244,0.0006343984,0.00001707925,0.0001937357,0.000009675387,0.000213385,0.001257484],"genre_scores_gemma":[0.2674992,0.0000189485,0.7318347,0.0003485749,0.00007167913,0.00004161619,0.000111504,0.000004169843,0.00006954378],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9801792,"threshold_uncertainty_score":0.4187855,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.006941790469211877,"score_gpt":0.2523070802488462,"score_spread":0.2453652897796344,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}