{"id":"W7084448284","doi":"","title":"QFrBLiMP: a Quebec-French Benchmark of Linguistic Minimal Pairs","year":2025,"lang":"en","type":"article","venue":"ArXiv.org","topic":"Infections and bacterial resistance","field":"Biochemistry, Genetics and Molecular Biology","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Académie française","keywords":"Benchmark (surveying); Hierarchy; Sentence; Statistical model; Computational linguistics; Competence (human resources); Phrase","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002836439,0.001922785,0.0006201569,0.003544982,0.002435375,0.001496904,0.002312016,0.002007843,0.007994579],"category_scores_gemma":[0.01474314,0.0003695572,0.0009842124,0.002331893,0.001239461,0.00167052,0.001742245,0.001474495,0.002394359],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.006154039,"about_ca_system_score_gemma":0.005305435,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.5207344,"about_ca_topic_score_gemma":0.5640981,"domain_scores_codex":[0.9972415,0.001184324,0.0001280478,0.0007097972,0.0005093373,0.0002270129],"domain_scores_gemma":[0.9901239,0.004358276,0.0003255339,0.001343772,0.00332382,0.0005247258],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.002672066,0.001334931,0.09645879,0.003066803,0.0008187147,0.003482169,0.004147321,0.1130601,0.01990713,0.0187022,0.4263266,0.3100231],"study_design_scores_gemma":[0.0006041116,0.0009752805,0.1737228,0.0008693053,0.0003184522,0.002701685,0.006587062,0.3651533,0.0200676,0.01437128,0.4141442,0.0004849342],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"empirical","genre_gemma":"dataset","genre_scores_codex":[0.6727485,0.005008847,0.06842867,0.0035649,0.0008246526,0.0013496,0.184754,0.01727469,0.04604606],"genre_scores_gemma":[0.6393156,0.0006205113,0.05190385,0.0009590674,0.0001221361,0.0009553061,0.2949282,0.001364567,0.009830816],"genre_candidate":"dataset","genre_consensus":null,"teacher_disagreement_score":0.4792656,"threshold_uncertainty_score":0.9641761,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.008121884167195278,"score_gpt":0.2490635179894339,"score_spread":0.2409416338222387,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}