{"id":"W7084138470","doi":"10.48550/arxiv.2509.25664","title":"QFrBLiMP: a Quebec-French Benchmark of Linguistic Minimal Pairs","year":2025,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Agriculture, Water, and Health","field":"Environmental Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Benchmark (surveying); Hierarchy; Sentence; Statistical model; Computational linguistics; Competence (human resources); Phrase","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002998658,0.0020788,0.0006545681,0.003712787,0.002553029,0.001569816,0.002577344,0.00214626,0.008103102],"category_scores_gemma":[0.015051,0.0004004291,0.001035497,0.002510077,0.001292052,0.001805059,0.002005606,0.00155226,0.00244995],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00617258,"about_ca_system_score_gemma":0.005538473,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.530223,"about_ca_topic_score_gemma":0.5829013,"domain_scores_codex":[0.996896,0.001282214,0.000138067,0.0008656796,0.0005660155,0.0002519604],"domain_scores_gemma":[0.9900463,0.004281176,0.0003199525,0.001505896,0.003290351,0.0005563232],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.002804016,0.001340733,0.09292137,0.003255527,0.0009110781,0.003708431,0.004117694,0.1186965,0.02140961,0.01674522,0.4085318,0.3255582],"study_design_scores_gemma":[0.0006371843,0.0009555149,0.1735139,0.0009135107,0.0003585273,0.002715611,0.00646322,0.3603038,0.0220132,0.01411107,0.417529,0.0004854058],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"empirical","genre_gemma":"dataset","genre_scores_codex":[0.6565816,0.005358647,0.07383547,0.003550436,0.000878451,0.001420835,0.1915422,0.01948938,0.04734299],"genre_scores_gemma":[0.617103,0.0006261973,0.05422163,0.0009830351,0.0001262793,0.0009708413,0.3144338,0.00151569,0.01001958],"genre_candidate":"dataset","genre_consensus":null,"teacher_disagreement_score":0.469777,"threshold_uncertainty_score":0.9450872,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0324122892452502,"score_gpt":0.1818366409700944,"score_spread":0.1494243517248442,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}