बोला गया सारांश — साथ पढ़ने के लिए प्ले दबाएँ: बोली जा रही पंक्ति ऊपर रहती है।
अनुमानित पढ़ने का समय: 8 मिनट
इस साइट पर हर पृष्ठ — इसी सहित — को एक ही स्वचालित पाइपलाइन द्वारा फाड़ा गया, प्रतिलेखित किया गया, सारांशित किया गया, सात भाषाओं में अनुवादित किया गया, और एक क्लोन किए गए वॉयस में जोर से पढ़ा गया। यह पृष्ठ वह उपकरण है जो अपने आप को समझाता है।
अंत तक आप क्या समझेंगे
- यह उपकरण एक वीडियो कोर्स को क्या बनाता है, और यह उपयोगी क्यों है
- आठ चरण जो सामग्री से गुजरती है, कच्चे वीडियो से तैयार पृष्ठ तक
- डिज़ाइन सिद्धांत जिन्होंने इसे कैसे बनाया गया है
यह उपकरण वास्तव में क्या करता है
Learning Companion एक वीडियो कोर्स लेता है जो बिल्कुल एक भाषा में मौजूद है, एक लॉगिन के पीछे, एक प्रारूप में जिसे आप केवल देख सकते हैं — और इसे कुछ ऐसा बनाता है जिसे आप पढ़ सकते हैं, खोज सकते हैं, अनुवाद कर सकते हैं, सुन सकते हैं, और अपनी पसंद की भाषा में अध्ययन कर सकते हैं। यह एक व्यक्ति को वीडियो पर बोलते हुए एक टिकाऊ, बहुभाषी, सुलभ अध्ययन संसाधन में बदलने के लिए एक असेंबली लाइन है।
आप इसे एक कोर्स देते हैं। यह आपको हर पाठ के लिए स्वच्छ लिखित अध्ययन नोट्स, एक समझ क्विज, पूरी चीज़ को जर्मन, फ्रेंच, डच, हिंदी, मंदारिन चीनी, और यहां तक कि क्लिंगन में अनुवादित, और एक मानव-ध्वनि वाली वॉयस में एक पढ़ने-साथ ऑडियो ट्रैक देता है जो प्रत्येक शब्द को हाइलाइट करता है जैसे ही यह बोला जाता है। फिर यह सभी को एक तेज़, स्थिर वेबसाइट के रूप में प्रकाशित करता है।
पाइपलाइन, चरण दर चरण
इसे एक कारखाने की लाइन के रूप में सोचें। सामग्री एक सिरे पर कच्ची प्रवेश करती है और दूसरे सिरे पर तैयार निकलती है। प्रत्येक स्टेशन एक काम करता है और अपना परिणाम अगले को सौंपता है।
चरण 1 — अंतर्ग्रहण: कच्ची सामग्री प्राप्त करें
स्रोत कोर्स एक होस्ट किए गए लर्निंग प्लेटफॉर्म पर रहते हैं, जहां पाठ या तो स्ट्रीम किए गए वीडियो या लिखित पृष्ठ हैं। उपकरण लॉगिन करता है, पाठों की खोज करता है, और स्रोत को खींचता है। यह अंतर्निहित वीडियो स्ट्रीम को सीधे डाउनलोड करता है, या जहां एक कोर्स पाठ-प्रथम है, वहां लिखित पाठ को स्क्रैप करता है।
चरण 2 — प्रतिलेखन: भाषण को पाठ में बदलें
प्रत्येक वीडियो की ऑडियो को एक speech-recognition model में फीड किया जाता है जो एक ग्राफिक्स कार्ड पर स्थानीय रूप से चलता है। यह एक समय-मुहूर्त प्रतिलेख तैयार करता है: न केवल क्या कहा गया, बल्कि कब। प्रत्येक वाक्यांश समयरेखा पर एक क्षण से जुड़ा हुआ है। ये समय बाद में महत्वपूर्ण होते हैं, जब शब्दों को ऑडियो के साथ संरेखित किया जाता है।
चरण 3 — सारांश: पाठ को आसवन करें
एक कच्ची प्रतिलेख वफादार है लेकिन पढ़ने में थकाऊ है। एक language model प्रत्येक प्रतिलेख को संरचित अध्ययन नोट्स में फिर से लिखता है: मुख्य विचार, स्वच्छ गद्य में, उस तरीके से संगठित जिस तरीके से आप वास्तव में संशोधन करना चाहते हैं। यह भाषण की दीवार और रखने योग्य नोट्स के एक सेट के बीच का अंतर है।
चरण 4 — क्विज: समझ की जांच करें
एक ही सामग्री से, उपकरण प्रत्येक पाठ के लिए एक छोटी समझ क्विज तैयार करता है, फ्लैशकार्ड ऐप्स में निर्यात करने के लिए तैयार। प्रश्न पाठ में विचारों का परीक्षण करते हैं और वक्ता या वीडियो के संदर्भ के बिना अपने आप पर खड़े होने के लिए लिखे गए हैं।
चरण 5 — अनुवाद: इसे दुनिया के लिए खोलें
हर पाठ — नोट्स, क्विज, पृष्ठ फर्नीचर, और पाठ और कोर्स शीर्षक — language models द्वारा प्रत्येक समर्थित भाषा में अनुवादित किया जाता है। अनुवाद परतों में होता है, इसलिए ब्रांड नाम बरकरार रहते हैं जबकि वर्णनात्मक पाठ अनुकूल होता है, और इसलिए एक लापता अनुवाद एक खाली छोड़ने के बजाय अंग्रेजी में सुंदरता से वापस आता है। कम-संसाधन भाषाएं जैसे Klingon को एक अतिरिक्त-दृढ़ निर्देश मिलता है, इसलिए मॉडल चुप्पी से अंग्रेजी में वापस नहीं जाता है।
चरण 6 — वॉयस: इसे सुनने योग्य बनाएं
यह वह हिस्सा है जिसे लोग अजीब पाते हैं। एक voice-cloning model प्रत्येक भाषा में प्रत्येक पाठ के लिए एक पढ़ने-साथ ऑडियो ट्रैक तैयार करता है, एक सुसंगत मानव-ध्वनि वाली वॉयस में। ऑडियो के साथ यह एक समय फ़ाइल तैयार करता है, इसलिए जैसे ही वॉयस बोलती है, मेल खाने वाला शब्द पृष्ठ पर प्रकाश में आता है — अध्ययन के लिए एक प्रकार का कराओके। Klingon अपवाद है: इसके पास कोई neural voice नहीं है, इसलिए इसकी ऑडियो रिकॉर्ड किए गए Klingon ध्वनियों की एक लाइब्रेरी से सिल दी जाती है। सर्वश्रेष्ठ-प्रयास, और प्रकृति से थोड़ा रोबोटिक।
चरण 7 — प्रकाशन: वेबसाइट को असेंबल करें
यह सभी एक सादे, तेज़ वेबसाइट में प्रस्तुत किया जाता है: प्रति भाषा पृष्ठों का एक सेट, साझा स्टाइलिंग और स्क्रिप्ट, एक कैटलॉग जो कोर्स को एक साथ बांधता है, और हल्के, गोपनीयता-सम्मानपूर्ण उपयोग विश्लेषण। कोई डेटाबेस नहीं है और रन टाइम पर कोई सर्वर-साइड कोड नहीं है — बस स्थिर फ़ाइलें जो तुरंत लोड होती हैं और लगभग कहीं भी होस्ट की जा सकती हैं।
चरण 8 — स्टोर और शिप: मास्टर रखें, केवल उत्पाद भेजें
पर्दे के पीछे उपकरण तीन स्तरों की फ़ाइलें रखता है। मास्टर — प्रतिलेख, lossless ऑडियो, और स्रोत नोट्स — कभी भी बिल्ड मशीन को नहीं छोड़ते। स्क्रैच स्तर कार्यशील फ़ाइलें रखता है जो हमेशा पुनर्जन्म हो सकती हैं। और तैयार साइट एकमात्र चीज़ है जो तैनात होती है। जब एक बिल्ड तैयार हो, तो केवल प्रकाशित साइट होस्टिंग बुनियादी ढांचे को सौंपी जाती है और लाइव हो जाती है। मूल्यवान कच्ची सामग्री घर रहती है।
यह इस तरह क्यों बनाया गया है
कुछ सिद्धांतों ने डिज़ाइन को आकार दिया:
- प्रत्येक चरण एक काम करता है। प्रतिलेखन में एक विफलता अनुवाद को भ्रष्ट नहीं करती है, और किसी भी एकल स्टेशन को पूरे कोर्स को फिर से बनाए बिना फिर से चलाया जा सकता है।
- स्थानीय को प्राथमिकता दें, lossless को प्राथमिकता दें, मुक्त को प्राथमिकता दें। भारी उठान — speech recognition और voice synthesis — एक स्थानीय ग्राफिक्स कार्ड पर चलता है। ऑडियो मास्टर lossless रखे जाते हैं। अनुवाद सबसे लागत-प्रभावी मॉडल का उपयोग करता है जो वफादार रहता है।
- कुछ भी चुप्पी से आधा-समाप्त नहीं होता है। ताज़गी जांच का मतलब है कि एक पाठ केवल ऑडियो भेजता है जब वह ऑडियो वास्तव में अद्यतन हो, इसलिए एक कोर्स आंशिक रूप से अनुवादित जा सकता है पूर्ण होने का दिखावा किए बिना।
- उत्पाद स्रोत से अलग है। जो शिक्षार्थी देखते हैं वह एक स्वच्छ स्थिर साइट है। प्रतिलेख और मास्टर जिन्होंने इसे बनाया वह निजी रहते हैं।
संक्षेप में
आपने एक बार एक वीडियो देखा। इस उपकरण ने इसे देखा, इसे लिख दिया, इसे समझाया, आपको इस पर क्विज किया, इसे सात तरीकों से अनुवादित किया, और इसे एक वॉयस में आपको वापस पढ़ा — और फिर बिल्कुल उसी तरीके से वह बहुत पृष्ठ बनाया जो आप अभी पढ़ रहे हैं।
No flashcards for this lesson.