{"id":"W2573266127","doi":"10.63317/2z8qjf6d9e4t","title":"Evaluating a Topic Modelling Approach to Measuring Corpus Similarity","year":2016,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Computer science; Similarity (geometry); Natural language processing; Task (project management); Information retrieval; Artificial intelligence; Text corpus; Image (mathematics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01596065,0.001364832,0.001628599,0.009953908,0.001780521,0.005506328,0.002135033,0.003252711,0.001865052],"category_scores_gemma":[0.08137304,0.0005368922,0.001898729,0.007547434,0.0008338693,0.006312611,0.003218722,0.001904876,0.001233002],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002055106,"about_ca_system_score_gemma":0.002291714,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008200644,"about_ca_topic_score_gemma":0.009192551,"domain_scores_codex":[0.9827741,0.00901504,0.001477639,0.002435545,0.003859478,0.0004381725],"domain_scores_gemma":[0.9304898,0.05590816,0.001521713,0.003539695,0.007377994,0.001162523],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.004166876,0.001427512,0.05456507,0.001727426,0.002456472,0.0004437814,0.003459578,0.08280246,0.02736314,0.00831169,0.01274309,0.8005329],"study_design_scores_gemma":[0.0002288328,0.001295016,0.02160637,0.0001304408,0.0009890913,0.0006800659,0.001617398,0.9415753,0.01578476,0.009619833,0.006331123,0.0001416435],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4657173,0.006179077,0.5105366,0.0008339058,0.0005771643,0.001025841,0.002219752,0.005012762,0.007897618],"genre_scores_gemma":[0.7376606,0.001242811,0.2502108,0.0001684356,0.0002999,0.0006482025,0.006755617,0.0006329028,0.002380772],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01596065,"threshold_uncertainty_score":0.084409,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2631698706386932,"score_gpt":0.3149622874195979,"score_spread":0.05179241678090468,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}