Haastattelujen automaattinen litterointi uutistyössä ja haastateltavan oikeudet
Bibliographic record
Abstract
Tässä tutkielmassa selvitetään, kuinka laajasti automaattisia litterointiohjelmia on otettu käyttöön uutistoimituksissa Suomessa ja ulkomailla. Lisäksi tarkoituksena on muun muassa selvittää, voivatko haastateltavan oikeudet asettaa reunaehtoja automaattiselle litterointiprosessille. Tutkielman aineisto on kerätty vuoden 2019 joulukuussa kyselyin. Aineisto koostuu 18 eri uutismedian vastauksista. Medioista kuusi on Suomesta ja 12 muista maista. Kaikki ulkomaalaiset mediat sekä yksi suomalaisista medioista ovat uutistoimistoja ja MINDS-yhteistyöverkoston jäseniä. Taustatietoa tutkielman aiheesta on haettu aiemman tutkimuksen ja kirjallisuuden lisäksi asiantuntijahaastatteluilla. Haastatteluja tehtiin kolme vuosien 2019 ja 2020 aikana. Metodina tässä tutkielmassa on käytetty laadullista aineiston analyysia ja sisällön erittelyä. Valtaosa avointen kysymysten vastauksista on analysoitu sisällön erittelyn avulla, ja analyysissa käytettävät sisältöluokat on luotu aineiston pohjalta. Aineisto on luokiteltu ensin automaattisia litterointiohjelmia käyttäviin medioihin, ohjelmien käyttöönottoa suunnitteleviin medioihin, käyttöönottoa pohtineisiin medioihin sekä medioihin, joissa asiaa ei ole edes pohdittu. Tämän jälkeen kyselyiden vastauksia on tarkemmin avattu ja analysoitu sisällön erittelyn keinoin osittain aiemmin mainittujen luokkien sisällä sekä osittain niiden ulkopuolella. Tutkielma osoittaa, että automaattisten litterointiohjelmien käyttö uutistyössä kiinnostaa medioita ja on jo joissakin uutismedioissa tullut osaksi uutistyötä. Ainoastaan yksi mukana olleista medioista ei ollut edes pohtinut automaattisten litterointiohjelmien käyttöönottoa. Tutkielman tulosten perusteella automaattisten litterointiohjelmien merkitys uutistyössä on kasvussa ja ohjelmista on tulossa yhä yleisempi työväline uutistoimituksissa. Siitä ollaan kuitenkin edelleen kaukana, että haastattelujen litterointi uutistoimituksissa olisi yleinen käytäntö. Vain harva tähän tutkielmaan osallistuneista medioista arvioi, että haastateltavan oikeudet voisivat asettaa reunaehtoja automaattiselle litterointiprosessille. Tutkielman toimeksiantaja oli Suomen Tietotoimisto (STT).
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.004 | 0.005 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.002 | 0.002 |
| Science and technology studies | 0.004 | 0.002 |
| Scholarly communication | 0.007 | 0.004 |
| Open science | 0.001 | 0.005 |
| Research integrity | 0.002 | 0.003 |
| Insufficient payload (model declined to judge) | 0.123 | 0.031 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".