Gesproken samenvatting — druk op afspelen om mee te lezen: de gesproken regel blijft bovenaan.
Geschatte leestijd: 8 minuten
Elke pagina op deze site — inclusief deze — is gedownload, getranscribeerd, samengevat, vertaald naar zeven talen, en voorgelezen in een gekloneerde stem door dezelfde geautomatiseerde pijplijn. Deze pagina is het gereedschap dat zichzelf uitlegt.
Wat je aan het einde begrijpt
- Wat dit gereedschap van een videocursus maakt, en waarom dat nuttig is
- De acht stadia die het materiaal doorloopt, van ruwe video tot afgewerkte pagina
- De ontwerpprincipes die hebben bepaald hoe het is gebouwd
Wat dit gereedschap eigenlijk doet
De Learning Companion neemt een videocursus die in precies één taal bestaat, achter een login, in een formaat dat je alleen kunt bekijken — en verandert het in iets wat je kunt lezen, doorzoeken, vertalen, beluisteren, en waaruit je in de taal van je keuze kunt studeren. Het is een lopende band voor het omzetten van een persoon die op video spreekt in een duurzame, meertalige, toegankelijke studieresource.
Je geeft het een cursus. Het geeft je terug schone geschreven studieaantekeningen voor elke les, een begriptoets, het geheel vertaald naar Duits, Frans, Nederlands, Hindi, Mandarijn Chinees, en zelfs Klingon, en een meelees-audiotrack in een mensachtig klinkende stem die elk woord markeert terwijl het wordt gesproken. Vervolgens publiceert het dit alles als een snelle, statische website.
De pijplijn, stadium voor stadium
Denk eraan als een fabriekslijn. Materiaal komt aan het ene uiteinde rauw binnen en verlaat het andere uiteinde afgewerkt. Elk station doet één taak en geeft het resultaat door aan het volgende.
Stadium 1 — Inname: het ruwe materiaal ophalen
De broncursussen bevinden zich op een gehoste leerplatform, waar lessen ofwel gestreamde video's ofwel geschreven pagina's zijn. Het gereedschap logt in, ontdekt de lessen, en haalt de bron op. Het downloadt de onderliggende videostroom rechtstreeks, of schraapt de geschreven lestekst waar een cursus tekstgeoriënteerd is.
Stadium 2 — Transcriberen: spraak in tekst omzetten
De audio van elke video wordt ingevoerd in een spraakherkenningsmodel dat lokaal op een grafische kaart draait. Het produceert een transcript met tijdstempel: niet alleen wat werd gezegd, maar wanneer. Elke zin is vastgepind aan een moment op de tijdlijn. Deze timings zijn belangrijk later, wanneer woorden met audio worden uitgelijnd.
Stadium 3 — Samenvatten: de les destilleren
Een rauw transcript is trouw maar vermoeiend om te lezen. Een taalmodel herschrijft elk transcript in gestructureerde studieaantekeningen: de belangrijkste ideeën, in schone proza, georganiseerd op de manier waarop je eigenlijk wilt herhalen. Dit is het verschil tussen een muur van spraak en een set aantekeningen die het waard zijn om te bewaren.
Stadium 4 — Toets: begripcontrole
Uit hetzelfde materiaal genereert het gereedschap een korte begriptoets voor elke les, klaar om in flashcard-apps te exporteren. De vragen testen de ideeën in de les en zijn geschreven om op zichzelf te staan, zonder verwijzingen terug naar de spreker of de video.
Stadium 5 — Vertalen: het openen voor de wereld
Elke tekst — de aantekeningen, de toets, de pagina-inrichting, en de les- en cursustitels — wordt door taalmodellen in elke ondersteunde taal vertaald. Vertaling gebeurt in lagen, zodat merknamen intact blijven terwijl beschrijvende tekst zich aanpast, en zodat een ontbrekende vertaling elegant terugvalt op Engels in plaats van een blanco ruimte achter te laten. Talen met weinig middelen zoals Klingon krijgen een extra sterke instructie, zodat het model niet stilletjes terug naar Engels drijft.
Stadium 6 — Stem: het luisterbaar maken
Dit is het gedeelte dat mensen onheimelijk vinden. Een stemkloningsmodel genereert een meelees-audiotrack voor elke les in elke taal, in een consistente mensachtig klinkende stem. Naast de audio produceert het een timingbestand, zodat terwijl de stem spreekt, het overeenkomstige woord op de pagina oplicht — een soort karaoke voor studeren. Klingon is de uitzondering: het heeft geen neurale stem, dus de audio ervan wordt samengesteld uit een bibliotheek van opgenomen Klingon-geluiden. Best-effort, en van nature een beetje robotachtig.
Stadium 7 — Publiceren: de website samenstellen
Dit alles wordt weergegeven in een eenvoudige, snelle website: één set pagina's per taal, gedeelde styling en scripts, een catalogus die de cursussen aan elkaar bindt, en lichte, privacyrespecterende gebruiksanalytica. Er is geen database en geen servercode tijdens runtime — alleen statische bestanden die onmiddellijk laden en bijna overal kunnen worden gehost.
Stadium 8 — Opslaan en verzenden: de masters bewaren, alleen het product verzenden
Achter de schermen bewaart het gereedschap drie lagen bestanden. De masters — transcripten, verliesloze audio, en bronautekeningen — verlaten nooit de bouwmachine. De scratchlaag bevat werkbestanden die altijd opnieuw kunnen worden gegenereerd. En de afgewerkte site is het enige wat wordt geïmplementeerd. Wanneer een build klaar is, wordt alleen de gepubliceerde site aan de hostinginfrastructuur gegeven en gaat live. Het waardevolle ruwe materiaal blijft thuis.
Waarom het op deze manier is gebouwd
Een paar principes hebben het ontwerp bepaald:
- **Elk stadium doet één ding. ** Een fout in transcriptie corrumpeert niet de vertaling, en elk enkel station kan opnieuw worden uitgevoerd zonder de hele cursus opnieuw op te bouwen.
- **Geef de voorkeur aan lokaal, geef de voorkeur aan verlieslos, geef de voorkeur aan gratis. ** Het zware werk — spraakherkenning en spraaksynthese — draait op een lokale grafische kaart. Audio-masters worden verlieslos bewaard. Vertaling gebruikt het meest kosteneffectieve model dat trouw blijft.
- **Niets eindigt stilletjes half. ** Versheidscontroles betekenen dat een les alleen audio verzendt wanneer die audio eigenlijk up-to-date is, zodat een cursus gedeeltelijk vertaald live kan gaan zonder voor te wenden compleet te zijn.
- **Het product kan van de bron worden gescheiden. ** Wat leerlingen zien is een schone statische site. De transcripten en masters die het hebben gemaakt, blijven privé.
Kort gezegd
Je keek eenmaal naar een video. Dit gereedschap keek ernaar, schreef het op, legde het uit, toetste je erop, vertaalde het zeven manieren, en las het je voor in een stem — en bouwde vervolgens de pagina die je nu leest op precies dezelfde manier.
No flashcards for this lesson.