Aktualisering av Nätra-underlaget, etapp 2, del 2: Möjliga datakällor
Notice bibliographique
Résumé
I Del 2 ändrade vi inriktning på projektet då vi kommit till slutsatsen att det med dagensförutsättningar inte är möjligt att aktualisera NÄTRA-underlaget med enenkätundersökning. Dessutom är enkätundersökningar problematiska att använda fördenna typ av undersökning, framför allt på grund av problem med svarsbenägenhet.Vi kom till slutsatsen att det finns ett behov att ta ett steg tillbaka och undersöka vilkametoder som är mest lovande att använda för framställning och utveckling avkunskapsunderlag om regionala näringslivstransporter. Det finns en rad möjliga metodermed olika för- och nackdelar – där vissa är mer lovande på kort sikt och andra ärintressanta på längre sikt. Tillsammans med Trafikverket kom vi fram till att vi tror att detär viktigt att först genomföra en bred inventering av möjliga datakällor för att sen kunnautvärdera vilka metoder som är mest lovande för att förbättra kunskapsunderlaget omregionala näringslivstransporter.Vi genomförde därför en bred kartläggning av trafikflödes- och passagemätningar,statistiska undersökningar och registerdata, företagssystem, samt tidigare relevantastudier och kartläggningar. Inventeringen visade på olika för- och nackdelar med olikadatakällor och insamlingsmetoder. Vi studerade även de modellansatser som finns för attfånga regionala näringslivstransporter kopplat till det databehov som finns i dessamodeller. Efter att ha utvärderat dessa landade vi i att det som var intressant attundersöka närmare inom ramen för projektet var registerdata, modellutveckling samt enbeskrivning av vissa branscher, vilket vi fördjupade oss i.Fördjupningen kring registerdata visade att det finns möjligheter till framtagning avunderlag kring exempelvis fördelning av passager vid trängselskatteportaler med olikafordonstyper. Genom att koppla registerdata till trängselskattedata, är det möjligt attkoppla på branschtillhörighet och göra antaganden om vilka fordon som tillhör lättyrkestrafik exempelvis genom ägartyp, bilmärke, etc. Även vissa uppskattningar om andelutländska fordon vid passager är möjliga att göra. Användning av registerdata är relativtsett resurs- och tidseffektivt då registerdata redan är sammanställd. Utveckling av enlämplig metod för att säkerställa kvalitet och att rätt data tas fram krävs. Initialt krävs attett registeruttag skapas, vilket kan vara problematiskt beroende på vilken organisationsom söker åtkomst till data och hur kontakten med utlämnarorganisationen ser ut. Oftastär det lättast att få åtkomst till sekretesskyddade data för forskare på högskolor ochuniversitet.Fördjupningen kring modellutveckling visade att det finns olika sätt som modeller kringregionala näringslivstransporter kan utvecklas. En variant är att med metaanalys av tillgänglig data från olika källor, sammanställa det och sedan använda olika statistiskametoder för att skatta parametrar i modeller som kan användas för att görascenarioanalyser och prognoser. En annan variant är att med hjälp av mer aktuella indata(alstringstal och körsträckefördelning samt observerade trafikflöden) med bättre kvalitet,förbättra den modellering av lätt yrkestrafik som tagits fram vid konstruktionen av lättyrkestrafik till Sampers regionala modeller (Edwards et al., 201b7). Ytterligare en variantär att estimera multinomiala logitmodeller av motsvarande typ som man gjort i Calgary iKanada baserat på exempelvis insamlade data från GPS-mottagare, för att sedankombinera det med samsdata på områdesnivå och annan data av intresse. Det bör ocksåvara möjligt att estimera nya OD-matriser för näringslivets transporter med hjälp avträngselskattedata i kombination med annan registerdata.I fördjupningen kring branscher diskuterades branschindelningar generellt – och lättyrkestrafik och byggbranschen beskrevs mer specifikt. Fokus i beskrivningen var påmöjligheten till insamling av information och hur branscherna i stort ser ut.Olika datakällor är intressanta på olika tidshorisont och för olika syften. På kortare siktmenar vi att det viktigaste är att undersöka användbarheten på relativt sett lättillgängligaoch kvalitetssäkrade data såsom registerdata.Vilken data som framför allt är intressant att använda beror på vilken modell somanvänds. Vi menar därför att det är viktigt att fortsätta modellutvecklingen och att följautvecklingen inom området. Detta är ett mer långsiktigt arbete.Det är också viktigt att parallellt fortsätta att undersöka datakällor som på längre sikt kanbli intressanta att använda för detta ändamål. Exempelvis företagssystem är en intressantdatakälla där det finns information som kan vara intressant underlag om regionalanäringslivstransporter. I nuläget är det flera frågor som är oklara, t.ex. kopplat till hurdataunderlaget skulle kunna tillgängliggöras. Dessutom kräver det troligtvisutvecklingsarbete för att tillgängliggöra ett sådant underlag.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,010 | 0,019 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,002 | 0,003 |
| Études des sciences et des technologies | 0,003 | 0,001 |
| Communication savante | 0,017 | 0,013 |
| Science ouverte | 0,002 | 0,007 |
| Intégrité de la recherche | 0,003 | 0,004 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,108 | 0,063 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».