{"id":"W6890357168","doi":"10.35111/wxrn-qr14","title":"Benchmarks for Open Relation Extraction","year":2014,"lang":"en","type":"other","venue":"Americanae (AECID Library)","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Relationship extraction; Relation (database); Scripting language; Task (project management); Set (abstract data type); Binary relation; Benchmark (surveying); Sentence; Training set; Information extraction","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01196811,0.003025264,0.001887885,0.01126795,0.004175735,0.00587832,0.004979575,0.002874614,0.02283736],"category_scores_gemma":[0.04932044,0.001310367,0.002329082,0.01158854,0.001705135,0.006645817,0.006242486,0.002960804,0.02091537],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004094814,"about_ca_system_score_gemma":0.005448577,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02705985,"about_ca_topic_score_gemma":0.03547399,"domain_scores_codex":[0.9773033,0.005535308,0.003477027,0.002880237,0.009568539,0.001235528],"domain_scores_gemma":[0.9401852,0.02367221,0.002317943,0.01175933,0.02037833,0.001687084],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001115904,0.0007046951,0.004922773,0.007094068,0.0002205759,0.0008752018,0.001242243,0.01027737,0.01114348,0.02319112,0.5846797,0.3545329],"study_design_scores_gemma":[0.0003773086,0.0002957671,0.01051468,0.001274733,0.0001250605,0.001157529,0.001088674,0.03930828,0.03625257,0.02356304,0.8858311,0.0002112863],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"methods","genre_scores_codex":[0.0623785,0.01962892,0.2404369,0.005240088,0.003687807,0.003866584,0.3934291,0.114744,0.1565882],"genre_scores_gemma":[0.04861725,0.001942437,0.1873905,0.0006471021,0.0003326312,0.001729748,0.7407885,0.006202891,0.01234884],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.02705985,"threshold_uncertainty_score":0.07639861,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01360695840352202,"score_gpt":0.2791115131780302,"score_spread":0.2655045547745082,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}