شور میٹر - شور کو دبانے کی گہری سمجھ حاصل کریں۔
شور کو دبانے کے درمیان بنیادی فرق کو سمجھنے کے بعد (دور دراز کے سننے والوں کے لیے اسپیکر کے ماحولیاتی شور کو صاف طور پر سننے کے لیے دبانا) اور فعال شور میں کمی (سننے والے کے اپنے ماحولیاتی شور کو دور کرنا)، آئیے اس بات پر توجہ مرکوز کریں کہ شور کو دبانے کے طریقے کو کیسے حاصل کیا جائے۔
ڈیٹا کو دبانے کے لیے ایک سے زیادہ مائیکروفون استعمال کرنا ایک طریقہ ہے۔ متعدد مقامات سے ڈیٹا اکٹھا کرنے کے نتیجے میں آلات ایک جیسے (لیکن اب بھی مختلف) سگنل وصول کریں گے۔ بولنے والی آبادی کے قریب مائیکروفون کے ذریعہ موصول ہونے والا صوتی سگنل ثانوی مائکروفون کے مقابلے میں نمایاں طور پر مضبوط ہے۔ دو مائیکروفون ایک جیسی سگنل کی طاقت کے ساتھ نان وائس بیک گراؤنڈ ساؤنڈ حاصل کریں گے۔ مضبوط صوتی مائیکروفون اور ثانوی مائیکروفون کے ذریعہ جمع کردہ آواز کی معلومات کو منہا کریں، اور بقیہ اکثریت صوتی معلومات کی ہے۔ مائیکروفونز کے درمیان فاصلہ جتنا زیادہ ہوگا، قریب اور دور کے مائیکروفون کے درمیان سگنل کا فرق اتنا ہی زیادہ ہوگا، جس سے شور کو دبانے کے لیے اس سادہ الگورتھم کا استعمال آسان ہوجاتا ہے۔ تاہم، جب آپ بول نہیں رہے ہوں گے، یا جب آپ توقع کرتے ہیں کہ وقت کے ساتھ صوتی ڈیٹا میں تبدیلی آئے گی (جیسے کہ جب آپ چلتے ہیں یا بھاگتے ہیں، اور آپ کا فون ہلتا رہتا ہے)، اس طریقہ کی تاثیر کم ہو جائے گی۔ ملٹی مائکروفون شور کو دبانا یقینی طور پر قابل اعتماد ہے، لیکن اضافی ہارڈ ویئر اور پروسیسنگ میں خامیاں ہیں۔
تو، اگر صرف ایک مائکروفون ہوتا تو کیا ہوتا؟ اگر تصدیق/موازنے کے لیے اضافی صوتی ذرائع استعمال نہیں کیے جاتے ہیں، تو ایک ہی مائکروفون حل موصول ہونے والی شور کی خصوصیات کو سمجھنے اور انہیں فلٹر کرنے پر انحصار کرے گا۔ یہ مستحکم حالت اور غیر مستحکم شور کی پہلے بیان کردہ تعریفوں سے متعلق ہے۔ مستحکم حالت کے شور کو DSP الگورتھم کے ذریعے مؤثر طریقے سے فلٹر کیا جا سکتا ہے، جب کہ غیر سٹیشنری شور ایک چیلنج بنتا ہے، ڈیپ نیورل نیٹ ورک (DNNs) مسئلے کو حل کرنے میں مدد کر سکتے ہیں۔
یہ طریقہ نیٹ ورک کی تربیت کے لیے ڈیٹا سیٹ کی ضرورت ہے۔ یہ ڈیٹا سیٹ مختلف (مستحکم حالت اور غیر سٹیشنری) شور اور واضح تقریر پر مشتمل ہوتا ہے، جس سے ایک ترکیب شدہ شور والی تقریر کا نمونہ بنتا ہے۔ ڈیٹاسیٹ کو بطور ان پٹ DNN میں فیڈ کریں اور اسے واضح آواز کے ساتھ آؤٹ پٹ کریں۔ یہ ایک نیورل نیٹ ورک ماڈل بنائے گا جو شور کو ختم کرے گا اور صرف واضح تقریر کو آؤٹ پٹ کرے گا۔
یہاں تک کہ تربیت یافتہ DNNs کے ساتھ، ابھی بھی کچھ چیلنجز اور اشارے پر غور کرنا ہے۔ اگر آپ کم تاخیر کے ساتھ حقیقی وقت میں چلنا چاہتے ہیں، تو آپ کو مضبوط پروسیسنگ پاور یا چھوٹے DNN کی ضرورت ہے۔ DNN میں جتنے زیادہ پیرامیٹرز ہوں گے، اس کے چلنے کی رفتار اتنی ہی کم ہوگی۔ آڈیو کے نمونے لینے کی شرح آواز کو دبانے پر ایک جیسا اثر رکھتی ہے۔ اعلی نمونے لینے کی شرح کا مطلب یہ ہے کہ DNN کو مزید پیرامیٹرز کو سنبھالنے کی ضرورت ہے، لیکن اس کے نتیجے میں، یہ اعلی معیار کی پیداوار حاصل کرے گا۔ نارو بینڈ صوتی مواصلات ریئل ٹائم شور کو دبانے کے لیے ایک مثالی انتخاب ہے۔
اس قسم کی پروسیسنگ تمام گہرے کام ہیں، اور کلاؤڈ کمپیوٹنگ اس طرح کے کاموں کو مکمل کرنے میں بہت ہنر مند ہے، لیکن یہ طریقہ تاخیر کو نمایاں طور پر بڑھاتا ہے۔ اس بات پر غور کرتے ہوئے کہ انسان تقریباً 108 ملی سیکنڈ یا اس سے زیادہ کی تاخیر کو قابل اعتماد طریقے سے پہچان سکتے ہیں، کلاؤڈ کمپیوٹنگ پروسیسنگ کی وجہ سے ہونے والی اضافی تاخیر واضح طور پر کوئی مثالی نتیجہ نہیں ہے۔ تاہم، کنارے پر DNN چلانے کے لیے کچھ ہوشیار ایڈجسٹمنٹ کی ضرورت ہوتی ہے۔ CEVA ہمیشہ ہماری آواز اور اسپیچ پروسیسنگ کی صلاحیتوں کو بہتر بنانے کے لیے پرعزم ہے۔ اس میں توثیق شدہ تقریر کی وضاحت اور کمانڈ کی شناخت کے الگورتھم شامل ہیں - یہ الگورتھم کناروں پر بھی واضح مواصلات اور آواز کا کنٹرول فراہم کرتے ہیں۔ ہم سے رابطہ کرنے اور ذاتی طور پر سننے میں خوش آمدید۔






