{"id":"W4412014287","doi":"10.1038/s41598-025-09052-5","title":"Benchmarking pre-trained text embedding models in aligning built asset information","year":2025,"lang":"en","type":"article","venue":"Scientific Reports","topic":"Topic Modeling","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"École de Technologie Supérieure","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Benchmarking; Computer science; Embedding; Asset (computer security); Data science; Artificial intelligence; Information retrieval; Natural language processing; Business; Computer security","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004103681,0.001965347,0.0007677356,0.003045195,0.0005568041,0.001714581,0.001723136,0.001488337,0.002398471],"category_scores_gemma":[0.01274533,0.0003115109,0.001259347,0.002766001,0.0006049572,0.003838421,0.001627992,0.00193465,0.003499318],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009878832,"about_ca_system_score_gemma":0.001090557,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005903249,"about_ca_topic_score_gemma":0.00831981,"domain_scores_codex":[0.9974257,0.001215295,0.0002580378,0.0006877253,0.0002791886,0.0001339822],"domain_scores_gemma":[0.9937612,0.003972526,0.000244623,0.0009575198,0.0009063082,0.0001578266],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008245557,0.00116,0.01214342,0.00167943,0.0005249424,0.000379749,0.0007361717,0.2236098,0.01119613,0.003474727,0.03481966,0.7094514],"study_design_scores_gemma":[0.00008294305,0.0003697489,0.004964784,0.0001928993,0.0001437291,0.0002178585,0.0006102123,0.9593728,0.01426226,0.005003321,0.01470931,0.00007014738],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4786127,0.0086661,0.4586688,0.001706968,0.001874967,0.00132285,0.01681882,0.0188158,0.01351298],"genre_scores_gemma":[0.6072483,0.002257788,0.3008481,0.0005971245,0.0003219004,0.0009537547,0.07980311,0.0008790373,0.007090783],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.005903249,"threshold_uncertainty_score":0.02170259,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01602443871516109,"score_gpt":0.279335461706418,"score_spread":0.263311022991257,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}