ENGINE_CORE: UVR-MDX-NET-Voc_FT (ONNX Runtime v1.17)
precision_manufacturing مبدأ العزل الطيفي عبر الشبكات العصبية العميقة

كيف يفصل الذكاء الاصطناعي الصوت عن الموسيقى؟

النموذج العصبي لا «يحذف» الموسيقى ولا يقتطع ترددات كاملة، بل يحلل الخصائص الطيفية للموجة في الفضاء الزمني، ويتعلّم توقيع الصوت البشري بدقة داخل المزيج ثم يعيد توليد وبناء الصوت نقياً دون المساس بالنبرة الأصلية.

terminal حالة المعالجة المباشرة STFT::READY
$ haramlite-engine --infer
> Sample Rate: 44,100 Hz (Float32)
> Window: Hanning 2048 / Hop: 512
> Execution Target: DirectML / D3D12
01 / Architecture Pipeline

مخطط التحويل الترددي-الزمني STFT وتقدير قناع العزل

graphic_eq معالجة خطية على مستوى الإطار (Frame-level)
Phase 01 الموجة الصوتية المركبة (Mix)

استقبال إشارة الإدخال الصوتية 1D Time-Domain waveform حيث تمتزج موجات الآلات الموسيقية مع الأحبال الصوتية في مسار رقمي واحد.

t = 0.0s 1D Amplitude Domain t = 3.2s
Phase 02 طيف التردد والزمن (STFT Spectrogram)

تطبيق تحويل فورييه قصير المدى (Short-Time Fourier Transform) لتحويل الموجة إلى خريطة ثنائية الأبعاد (Magnitude + Phase) تشبه الصورة الحرارية.

Hz (Frequency) 2D STFT Grid Time (sec)
Phase 03 قناع العزل (Complex Masking & iSTFT)

يقوم نموذج UVR-MDX-NET بحساب مصفوفة الترجيح (Mask Matrix) لفصل صوت المتحدث ثم تطبيق التحويل العكسي iSTFT لاستعادة مسار الكلام المطهّر.

Voice Preserved Music Suppressed (<-48dB)
cancel المعالجة الكلاسيكية (EQ & Band-Pass Filters)

لماذا تفشل الفلاتر الترددية التقليدية؟

الفلاتر الهندسية الكلاسيكية تعتمد على اقتطاع حزم ترددية ثابتة (مثل إضعاف الترددات بين 200Hz و 4000Hz). بما أن صوت الإنسان والآلات الموسيقية (مثل البيانو والغيتار والأوتار) يتشاركون تماماً نفس الحيز الترددي، فإن النتيجة تكون تشويهاً كارثياً لصوت المتحدث وجعله خافتاً، مكتوماً، أو روبوتياً رديئاً.

سلامة الخواص الصوتية (Vocal Formants) تلف واضح في النبرة

* اقتطاع أعمى يفرغ خامات الحروف الحلقية والصفيرية.

check_circle معالجة الذكاء الاصطناعي (UVR-MDX ONNX)

كيف ينجح القناع العصبي في الحفاظ على النبرة؟

يتعلم النموذج تمييز «البصمة التوافقية» (Harmonic Signatures) للصوت البشري بدلاً من حظر التردد برمته. إذا تزامن صوت كمان مع مقطع كلام، يستطيع النموذج إزالة ذبذبات أوتار الكمان دون مساس بالذبذبة الخاصة بالحبال الصوتية، محافظاً على الدفء وعمق الصوت ومخارج الحروف.

سلامة الخواص الصوتية (Vocal Formants) يُحفظ الصوت البشري كما هو

* حماية ذكية لكافة مخارج الحروف والوقفات الصوتية الطبيعية.

02 / Execution Stages

ثلاث مراحل دقيقة: من التدفق الخام إلى مسار نقي

account_tree
01

تحويل الصوت إلى فضاء ترددي

تفكيك الموجة الخام عبر خوارزميات FFT إلى شرائح زمنية متتالية، وتحويل تذبذبات الضغط الهوائي إلى مصفوفة رقمية تمثل الترددات المتزامنة وقوتها النسبية في كل جزء من الثانية.

fn: STFT(sig, n_fft=2048)
02

استنتاج القناع عبر ONNX

تمرير الصورة الطيفية على نموذج UVR-MDX-NET لتقييم كل بكسل طيفي؛ حيث تزن الشبكة العصبية احتمالية كون الذبذبة صوتاً بشرياً أم نغمة موسيقية عبر ملايين المعاملات المُدربة.

fn: ONNXSession::Run(Mask)
03

إعادة البناء وسلسلة التحسين

إعادة دمج الطيف بعد الفصل عبر iSTFT لإنتاج مسار صوتي رقمي، يعقبه تطبيق فلاتر الحضور وتخطي فترات الصمت (Silence Skipping) لتقليل حجم وتشتيت المستمع.

fn: iSTFT + PresenceDSP()
03 / Performance Telemetry

تسريع العتاد المحلي: مصفوفة الأداء وزمن المعالجة

ملف اختبار: حلقة بودكاست 10 دقائق (WAV 44.1kHz)
DirectX 12 (DirectML) Universal GPU
161 ثانية (2.6 دقيقة)

الخيار الافتراضي المتوافق مع معظم كروت الشاشة الحديثة من AMD و Intel و NVIDIA دون إعدادات معقدة.

NVIDIA CUDA EP Ultra-Fast
88 ثانية (1.4 دقيقة)

أقصى أداء ممكن عبر أنوية Tensor Cores المخصصة؛ معالجة أسرع بحوالي 7 مرات من تشغيل المعالج المركزي بمفرده.

معالج النظام (CPU Fallback) Safe Fallback
285 ثانية (4.7 دقيقة)

يعمل تلقائياً عند عدم توفر بطاقة رسوميات منفصلة، مع ضمان دقة المعالجة والعزل نفسها تماماً دون أدنى نقصان.

verified_user

أمانة فنية: ما الذي لا يمكن للذكاء الاصطناعي فعله؟

warning التداخل الطيفي الشديد (Spectral Clashing)

عندما يتطابق صوت همهمة غنائي حاد مع نفس النغمة التوافقية لآلة وترية مسجلة برنين مرتفع (Heavy Reverb)، تترك الشبكة العصبية أثراً طفيفاً جداً تفادياً لاقتطاع جزء من خامة الصوت الأصلية.

warning الكورال المتعدد والتسجيلات المشوهة

التسجيلات القديمة أو المسجلة بمعدل ضغط منخفض جداً (مثل 64kbps MP3) تعاني من تشوه تكميمي رقمي (Quantization noise) يجعل التمييز الدقيق بين ترددات الخلفية ونبرة الحديث أصعب رياضياً.

lock خصوصية محلية 100% (Zero-Cloud Architecture)

تشغيل النموذج عبر مكتبات ONNX المترجمة ذاتياً يعني أن بياناتك الصوتية لا تغادر ذاكرة جهازك (RAM) قيد أنملة؛ لا خوادم، لا استعلامات واجهة، وبلا حاجة لأي اتصال شبكي.

model_training أوزان نموذجية مغلقة لا تُدرَّب على ملفاتك

النموذج مجمّد وجاهز (Pre-trained weights). لا توجد حلقة تغذية راجعة أو تجميع لعينات المستخدمين أو استخدام تسجيلاتك لتدريب نماذج تجارية أخرى.

04 / Questions & Answers

الأسئلة الشائعة حول محرك الفصل

help
ما هي بيئة تشغيل ONNX وما سبب اختيارها في HaramLite؟ expand_more
صيغة Open Neural Network Exchange هي المعيار الصناعي المفتوح لتشغيل النماذج الحسابية بأعلى كفاءة لغوية وتطبيقية على مستوى العتاد المحلي، مما يلغي تماماً الحاجة لبيئات بايثون الثقيلة أو الاتصال بخوادم سحابية خارجية، مع دعم كامل لتسريع DirectML و CUDA.
هل يستهلك الفصل الذاكرة العشوائية وموارد الجهاز بشكل مفرط؟ expand_more
تم تصميم محرك معالجة الحزم في HaramLite ليقسم الملفات الطويلة إلى شرائح مبرمجة زمنياً (Chunks) لا تتجاوز 15 ثانية للإطار الواحد، مما يبقي استهلاك الذاكرة العشوائية RAM ثابتاً في حدود 600 ميغابايت فقط بصرف النظر عن طول الملف الأصلي.
هل يختلف العزل إذا كان المحتوى ندوة حوارية أو مقطع فيديو يوتيوب؟ expand_more
يعمل النموذج على دقة فصل فائقة مع المقابلات والبودكاست بسبب وضوح المتحدث، في حين أن مقاطع اليوتيوب التي تحتوي مؤثرات تصويرية وانفجارات صوتية قد تتطلب تفعيل وضع تحسين الحضور الصوتي (Voice Boost DSP) للحفاظ على التوازن.
هل يتم حفظ أي سجلات أو نصوص مفرغة محلياً بعد انتهاء العملية؟ expand_more
لا يقوم التطبيق بإنشاء أي ملفات تسجيل telemetry أو تخزين سري. فور تصدير المسار الصوتي النظيف وإغلاق واجهة المعالجة، يتم مسح المصفوفات الرياضية المؤقتة من ذاكرة الجهاز تماماً.
verified تطبيق مفتوح المصدر ومستقل بالكامل

اختبر كفاءة المحرك العصبي على تسجيلاتك الآن

حمّل الإصدار الأحدث برابط مباشر، وأسقط ملفك الصوتي أو الفيديو في ثوانٍ، واستمع لنقاء النتيجة وقارن بين المسارين محلياً.

أدلة هندسية وتطبيقية ذات صلة

DOCUMENTATION_HUB