كيف يفصل الذكاء الاصطناعي الصوت عن الموسيقى؟
النموذج العصبي لا «يحذف» الموسيقى ولا يقتطع ترددات كاملة، بل يحلل الخصائص الطيفية للموجة في الفضاء الزمني، ويتعلّم توقيع الصوت البشري بدقة داخل المزيج ثم يعيد توليد وبناء الصوت نقياً دون المساس بالنبرة الأصلية.
مخطط التحويل الترددي-الزمني STFT وتقدير قناع العزل
استقبال إشارة الإدخال الصوتية 1D Time-Domain waveform حيث تمتزج موجات الآلات الموسيقية مع الأحبال الصوتية في مسار رقمي واحد.
تطبيق تحويل فورييه قصير المدى (Short-Time Fourier Transform) لتحويل الموجة إلى خريطة ثنائية الأبعاد (Magnitude + Phase) تشبه الصورة الحرارية.
يقوم نموذج UVR-MDX-NET بحساب مصفوفة الترجيح (Mask Matrix) لفصل صوت المتحدث ثم تطبيق التحويل العكسي iSTFT لاستعادة مسار الكلام المطهّر.
لماذا تفشل الفلاتر الترددية التقليدية؟
الفلاتر الهندسية الكلاسيكية تعتمد على اقتطاع حزم ترددية ثابتة (مثل إضعاف الترددات بين 200Hz و 4000Hz). بما أن صوت الإنسان والآلات الموسيقية (مثل البيانو والغيتار والأوتار) يتشاركون تماماً نفس الحيز الترددي، فإن النتيجة تكون تشويهاً كارثياً لصوت المتحدث وجعله خافتاً، مكتوماً، أو روبوتياً رديئاً.
* اقتطاع أعمى يفرغ خامات الحروف الحلقية والصفيرية.
كيف ينجح القناع العصبي في الحفاظ على النبرة؟
يتعلم النموذج تمييز «البصمة التوافقية» (Harmonic Signatures) للصوت البشري بدلاً من حظر التردد برمته. إذا تزامن صوت كمان مع مقطع كلام، يستطيع النموذج إزالة ذبذبات أوتار الكمان دون مساس بالذبذبة الخاصة بالحبال الصوتية، محافظاً على الدفء وعمق الصوت ومخارج الحروف.
* حماية ذكية لكافة مخارج الحروف والوقفات الصوتية الطبيعية.
ثلاث مراحل دقيقة: من التدفق الخام إلى مسار نقي
تحويل الصوت إلى فضاء ترددي
تفكيك الموجة الخام عبر خوارزميات FFT إلى شرائح زمنية متتالية، وتحويل تذبذبات الضغط الهوائي إلى مصفوفة رقمية تمثل الترددات المتزامنة وقوتها النسبية في كل جزء من الثانية.
استنتاج القناع عبر ONNX
تمرير الصورة الطيفية على نموذج UVR-MDX-NET لتقييم كل بكسل طيفي؛ حيث تزن الشبكة العصبية احتمالية كون الذبذبة صوتاً بشرياً أم نغمة موسيقية عبر ملايين المعاملات المُدربة.
إعادة البناء وسلسلة التحسين
إعادة دمج الطيف بعد الفصل عبر iSTFT لإنتاج مسار صوتي رقمي، يعقبه تطبيق فلاتر الحضور وتخطي فترات الصمت (Silence Skipping) لتقليل حجم وتشتيت المستمع.
تسريع العتاد المحلي: مصفوفة الأداء وزمن المعالجة
الخيار الافتراضي المتوافق مع معظم كروت الشاشة الحديثة من AMD و Intel و NVIDIA دون إعدادات معقدة.
أقصى أداء ممكن عبر أنوية Tensor Cores المخصصة؛ معالجة أسرع بحوالي 7 مرات من تشغيل المعالج المركزي بمفرده.
يعمل تلقائياً عند عدم توفر بطاقة رسوميات منفصلة، مع ضمان دقة المعالجة والعزل نفسها تماماً دون أدنى نقصان.
أمانة فنية: ما الذي لا يمكن للذكاء الاصطناعي فعله؟
عندما يتطابق صوت همهمة غنائي حاد مع نفس النغمة التوافقية لآلة وترية مسجلة برنين مرتفع (Heavy Reverb)، تترك الشبكة العصبية أثراً طفيفاً جداً تفادياً لاقتطاع جزء من خامة الصوت الأصلية.
التسجيلات القديمة أو المسجلة بمعدل ضغط منخفض جداً (مثل 64kbps MP3) تعاني من تشوه تكميمي رقمي (Quantization noise) يجعل التمييز الدقيق بين ترددات الخلفية ونبرة الحديث أصعب رياضياً.
تشغيل النموذج عبر مكتبات ONNX المترجمة ذاتياً يعني أن بياناتك الصوتية لا تغادر ذاكرة جهازك (RAM) قيد أنملة؛ لا خوادم، لا استعلامات واجهة، وبلا حاجة لأي اتصال شبكي.
النموذج مجمّد وجاهز (Pre-trained weights). لا توجد حلقة تغذية راجعة أو تجميع لعينات المستخدمين أو استخدام تسجيلاتك لتدريب نماذج تجارية أخرى.
الأسئلة الشائعة حول محرك الفصل
ما هي بيئة تشغيل ONNX وما سبب اختيارها في HaramLite؟ expand_more
هل يستهلك الفصل الذاكرة العشوائية وموارد الجهاز بشكل مفرط؟ expand_more
هل يختلف العزل إذا كان المحتوى ندوة حوارية أو مقطع فيديو يوتيوب؟ expand_more
هل يتم حفظ أي سجلات أو نصوص مفرغة محلياً بعد انتهاء العملية؟ expand_more
اختبر كفاءة المحرك العصبي على تسجيلاتك الآن
حمّل الإصدار الأحدث برابط مباشر، وأسقط ملفك الصوتي أو الفيديو في ثوانٍ، واستمع لنقاء النتيجة وقارن بين المسارين محلياً.
أدلة هندسية وتطبيقية ذات صلة
DOCUMENTATION_HUBإزالة الموسيقى من ملفات الفيديو
إعدادات بروفايل العزل، معالجة قنوات الصوت المحيطية 5.1 وإعادة تصدير الفيديو المتزامن.
مشاهدة يوتيوب دون موسيقى
ربط إضافة المتصفح بمحرك HaramLite المحلي عبر تقنية Native Messaging للتخطي الفوري.
معالجة سلاسل البودكاست
إعداد مجلدات المراقبة الآلية (Watch Folders) لمعالجة عشرات الحلقات المتتالية في الخلفية.