الحد الأدنى المحلي نقطة على سطح الخسارة تزيد عندها الخسارةُ مع أي خطوة صغيرة في أي اتجاه، رغم وجود حل أفضل في مكان آخر. ويتوقف التدريب هناك لأن النزول التدرّجي لا يرى إلا الجوار المباشر. وعمليًا، في الشبكات العميقة ذات المعاملات الكثيرة، تكون الحدود الدنيا المحلية الحقيقية أندر مما توحي به العبارة — فمعظم حالات التوقف هي نقاط سرج، أو معدل تعلّم تدهور أكثر من اللازم، أو استواء ناتج عن تشبّع دوال التفعيل. وتشخيص أيّها لديك أمر مهم، لأن للثلاثة معالجات مختلفة.

منحنى الخسارة المستوي عَرَضٌ لا تشخيص. واللجوء إلى مُحسِّن مختلف قبل تحديد السبب هو أكثر الطرق شيوعًا لإنفاق أسبوع من زمن المعالجة دون تحريك المؤشر.

آخر تحديث 23 Aug 2026 · Training and Optimization المحور

بنية معالجة مؤسسية تُستخدم في تدريب النماذج
كل إعادة تشغيل تخمينية تستهلك طاقة تدريب ثابتة داخل المقر. صورة سياقية لا نظام مورّد بعينه.

ما المشكلة التي يعالجها هذا الحل؟

يتدرّب نموذج تنبؤ بانصراف العملاء لدى مشغّل اتصالات على مدى أربعين دورة. تنخفض الخسارة بحدّة خلال ست دورات، ثم تستقر عند 0.42 وتبقى هناك. وتقف دقة التحقق عند 71% بينما تتطلب دراسة الجدوى 80%. يضاعف الفريق عدد الدورات، فلا يتغير شيء، فيستنتج أن النموذج بلغ سقفه.

وهذا الاستنتاج سابق لأوانه عادةً. فللمنحنى المستوي أسباب عدة غير متكافئة: قد يكون المُحسِّن داخل حوض حقيقي، أو عند نقطة سرج يكون التدرّج فيها قريبًا من الصفر دون أن تكون حدًّا أدنى، أو قد يكون معدل التعلّم تدهور حتى صارت الخطوات أصغر من أن تُفلت من أي شيء، أو قد يكون نصف وحدات ReLU قد مات وتوقف عن تمرير التدرّج أصلًا.

ولأن هذه الحالات تبدو متطابقة على مخطط الخسارة، كثيرًا ما تتنقل الفرق بين المُحسِّنات عشوائيًا: Adam، ثم SGD مع الزخم، ثم العودة إلى Adam بمعدل تعلّم مختلف — قدر كبير من المعالجة يُنفَق دون فرضية.

كيف يعمل الحل؟

افصل التشخيص عن المعالجة. سجّل معايير التدرّج لكل طبقة، ومعدل التعلّم الحالي، ونسبة التفعيلات التي تساوي صفرًا تمامًا. هذه الأرقام الثلاثة تميّز الأسباب الأربعة في تشغيلة واحدة.

فإذا كانت التدرّجات قريبة من الصفر في كل مكان وسطح الخسارة مستويًا في جميع الاتجاهات، فتلك حالة استواء أو سرج. وإذا كانت التدرّجات سليمة بينما تدهور معدل التعلّم إلى ما يقارب الصفر، فالمشكلة في الجدولة. وإذا كانت نسبة كبيرة من مخرجات ReLU أصفارًا، فالوحدات ميتة ولن يفيد تغيير المُحسِّن.

وتختلف التدخلات تبعًا لذلك: إعادة التشغيل الدافئة والزخم لنقاط السرج، وجدولة منقّحة عند فرط التدهور، وإعادة تهيئة الأوزان أو استخدام LeakyReLU للوحدات الميتة، وبذرة تهيئة مختلفة فعلًا عند الاشتباه بحوض حقيقي.

  1. 1
    النزول التدرّجي محلي كل خطوة تحرّك المعاملات عكس التدرّج المحسوب عند النقطة الحالية. ولا شيء في قاعدة التحديث يستطيع الرؤية أبعد من الجوار المباشر.
  2. 2
    الحد الأدنى حيث يتلاشى التدرّج عند النقطة الثابتة يكون التدرّج صفرًا، فيصبح التحديث صفرًا ويتوقف التدريب عن التحرّك مهما بقي من دورات.
  3. 3
    الانحناء يحدد النوع إذا انحنى كل اتجاه إلى أعلى فالنقطة حد أدنى محلي. وإذا انحنت بعض الاتجاهات إلى أسفل فهي نقطة سرج والإفلات ممكن.
  4. 4
    الأبعاد العالية تُرجّح السروج لكي تكون النقطة حدًّا أدنى محليًا حقيقيًا يجب أن ينحني كل اتجاه من ملايين الاتجاهات إلى أعلى في آن واحد — وهو احتمال أقل بكثير إحصائيًا من انحناء اتجاه واحد على الأقل إلى أسفل.
  5. 5
    الزخم يعبُر السرعة المتراكمة تتيح للمُحسِّن مواصلة العبور عبر منطقة تدرّجها قريب من الصفر بدل التوقف فيها.

البنية المرجعية

أربعة عوامل مستقلة تحدد ما إذا كان التدريب سيُفلت من منطقة مستوية. وتغييرها مجتمعةً يجعل النتيجة غير قابلة للتفسير.

LayerWhat it contains
سطح الخسارةتحدده البنية ودالة الخسارة والبيانات. والطبقات الأعرض والوصلات التخطّيية تميل إلى إنتاج أحواض معزولة أقل.
التهيئةالموضع الذي يبدأ منه التدريب على السطح. وتهيئة He أو Xavier تتجنب البدء في مناطق متشبّعة.
قاعدة التحديثالزخم وAdam وRMSProp، ولكلٍّ قدر مختلف من التاريخ المحمول عبر مناطق التدرّج المنخفض.
الجدولةمعدل التعلّم عبر الزمن. وإعادة التشغيل الدافئة ترفعه عمدًا مجددًا للإفلات من مناطق لا يستطيع معدل متدهور مغادرتها.

خيارات النشر: ينطبق ذلك على أي عتاد تدريب، لكن كلفة الخطأ تتناسب معه. فعلى عقدة متعددة وحدات المعالجة تُقاس إعادة التشغيل غير الضرورية بساعات من المعالجة، ولهذا يسدّد التشخيصُ قبل التدخّل كلفتَه سريعًا.

القدرات الرئيسية

تجهيز تشغيلات التدريب بأدوات القياس

تسجيل معايير التدرّج ومعدل التعلّم ونِسب الوحدات الميتة لكل طبقة، ليصبح لكل توقف سبب لا تخمين.

available

تصميم الجدولة وإعادة التشغيل

جدولة لمعدل التعلّم مع إعادات تشغيل دافئة محجّمة على ميزانية الدورات الفعلية.

available

مراجعة التهيئة

تهيئة مطابقة لدالة التفعيل حتى لا يبدأ التدريب في منطقة متشبّعة.

custom development

تقييم كفاءة المعالجة

حكم أمين على ما إذا كانت ساعات معالجة إضافية ستفيد قبل طلب العتاد.

custom development

التكاملات

تشخيصات التحسين تنتمي إلى منصة التدريب لا إلى دفتر ملاحظات، لأن قيمتها تأتي من المقارنة بين التشغيلات.

النظامنقطة التكامل والبيانات المتبادلةالاتجاه
تتبّع التجاربتسجيل منحنيات الخسارة ومعايير التدرّج والجدولات لكل تشغيلة حتى تصبح المقارنة بين تشغيلتين ذات معنى.bi-directional
تنسيق التدريبنقاط الحفظ تتيح استئناف التشغيلة من قبل التوقف بجدولة معدّلة.bi-directional
منصة المعالجةربط استغلال وحدات المعالجة بتقدّم التدريب حتى تصبح الطاقة العاطلة مرئية. ← AI Products Portfoliobi-directional

حالات الاستخدام والقطاعات

التنبؤ بانصراف عملاء الاتصالات

تستوي الشبكات الجدولية على مجموعات خصائص عريضة مبكرًا، والسبب عادةً الجدولة أو الوحدات الميتة لا هندسة السطح.

التنبؤ بالطلب في التجزئة

تتوقف نماذج التسلسل حين تتلاشى التدرّجات عبر آفاق طويلة، وهو ما يبدو استواءً لكنه مشكلة مختلفة.

كشف الشذوذ الصناعي

تستقر المرمّزات التلقائية على إعادة إنتاج المتوسط، وكثيرًا ما يكسر الزخم وإعادات التشغيل هذا التماثل.

تصنيف المستندات

الضبط الدقيق لمرمّز مدرَّب مسبقًا بمعدل تعلّم مرتفع جدًا يُتلف البنية المدرَّبة ويُنتج استواءً عنيدًا.

اعتبارات الإمارات والخليج

حيث يجب أن يبقى التدريب داخل المقر لأسباب إقامة البيانات، تكون طاقة وحدات المعالجة ثابتة ولا يمكن توسيعها مرنًا في منتصف المشروع. وهذا يجعل التشخيص قبل التدخّل مسألة ميزانية لا تفضيلًا هندسيًا: فكل إعادة تشغيل تخمينية تستهلك طاقة يحتاجها عبء عمل آخر. أكّد ساعات العقد المتاحة وسياسة الانتظار والجهة التي تعتمد إعادة التشغيل قبل التخطيط لجدول تدريب.

منهجية التنفيذ

  1. 1
    التجهيز بالقياس أولًا سجّل معيار التدرّج ومعدل التعلّم ونسبة الوحدات الميتة قبل تغيير أي شيء.
  2. 2
    استبعاد الجدولة إذا تدهور معدل التعلّم إلى ما يقارب الصفر، فذلك وحده يفسّر التوقف.
  3. 3
    فحص الوحدات الميتة وجود نسبة كبيرة من مخرجات ReLU الصفرية يعني أن تغيير المُحسِّن لن يفيد.
  4. 4
    إضافة الزخم أو إعادات التشغيل للمنطقة المستوية الحقيقية يكون الزخم وإعادات التشغيل الدافئة أرخص التدخلات الفعّالة.
  5. 5
    تغيير عنصر واحد في كل مرة تعديل المُحسِّن والجدولة والتهيئة معًا يجعل نسبة النتيجة إلى سبب أمرًا مستحيلًا.

الأمن وخيارات النشر

سجلات التدريب تُدوّن إحصاءات التدرّج وقيم الخسارة لا السجلات الخام، وهي عمومًا آمنة للاحتفاظ بها خارج نطاق البيانات. أما نقاط الحفظ فأمر مختلف: فأوزان نموذج مُلاءم على بيانات حساسة قد تُسرّب معلومات عن تلك البيانات، وينبغي تخزينها تحت الضوابط نفسها المطبّقة على مجموعة التدريب ذاتها.

مثال عملي

لنأخذ الدالة أحادية البعد L(x) = x⁴ − 3x³ + 2، وفيها انخفاض ضحل وآخر أعمق، لنرى كيف تحدد نقطةُ البداية النتيجةَ.

  1. المشتقة. L′(x) = 4x³ − 9x² = x² × (4x − 9)، فتقع النقطتان الثابتتان عند x = 0 وx = 2.25.
  2. تصنيفهما. L″(x) = 12x² − 18x. عند x = 2.25 تكون L″ = 20.25 > 0، أي حد أدنى حقيقي. وعند x = 0 تكون L″ = 0 — نقطة انعطاف شبيهة بالسرج، وليست حدًّا أدنى إطلاقًا.
  3. البدء عند x = 0.05. التدرّج = 4(0.000125) − 9(0.0025) = −0.0220، وهو ضئيل. وبمعدل تعلّم 0.01 تكون الخطوة 0.00022. فالتقدّم بالغ البطء والمنحنى يبدو مستويًا.
  4. إضافة الزخم. بزخم 0.9 تتراكم السرعة عبر الخطوات فتحمل المعامل عبر المنطقة المستوية باتجاه x = 2.25.

الدالة نفسها والمُحسِّن نفسه ونتيجة مختلفة — تحدّدها كليًا قدرةُ قاعدة التحديث على تراكم السرعة عبر منطقة مستوية. ومنحنى الخسارة في الحالة الأولى يبدو تمامًا كنموذج «تقارب».

مثال برمجي

بدل التخمين، جهّز التشغيلة بأدوات قياس. الشيفرة التالية تسجّل الكميات الثلاث التي تفصل بين الأسباب.

import torch
import torch.nn as nn

model = nn.Sequential(
    nn.Linear(32, 128), nn.ReLU(),
    nn.Linear(128, 64), nn.ReLU(),
    nn.Linear(64, 1),
)
optimizer = torch.optim.SGD(model.parameters(), lr=0.05, momentum=0.9)
scheduler = torch.optim.lr_scheduler.CosineAnnealingWarmRestarts(
    optimizer, T_0=10, T_mult=2,
)

dead_relu_fraction = {}

def record_dead(name):
    def hook(_module, _inp, out):
        dead_relu_fraction[name] = (out == 0).float().mean().item()
    return hook

for i, layer in enumerate(model):
    if isinstance(layer, nn.ReLU):
        layer.register_forward_hook(record_dead(f"relu_{i}"))

def diagnose(step):
    total = 0.0
    for p in model.parameters():
        if p.grad is not None:
            total += p.grad.detach().norm().item() ** 2
    grad_norm = total ** 0.5
    lr = optimizer.param_groups[0]["lr"]
    print(f"step={step} grad_norm={grad_norm:.6f} lr={lr:.6f} dead={dead_relu_fraction}")
    # grad_norm ~ 0 and lr healthy  -> plateau or saddle: try warm restarts
    # grad_norm healthy and lr ~ 0  -> schedule decayed too far
    # dead fraction > 0.5           -> dead ReLUs: re-init or use LeakyReLU

معيار التدرّج لكل خطوة، ومعدل التعلّم الحالي، ونسبة مخرجات ReLU الصفرية لكل طبقة. والتركيبة بينها تحدد أي الأسباب الثلاثة أمامك؛ والتعليقات تربط كل نمط بتدخّله المناسب.

فحوصات تشخيصية

  • ارسم معيار التدرّج إلى جانب الخسارة. فالخسارة المستوية مع تدرّجات سليمة ليست حدًّا أدنى — انظر إلى معدل التعلّم.
  • اطبع معدل التعلّم الحالي كل دورة. فجدولات التدهور الحادّة كثيرًا ما تبلغ قيمًا أصغر من أن تحرّك شيئًا.
  • قِس نسبة تفعيلات ReLU التي تساوي صفرًا تمامًا. فتجاوزها النصف تقريبًا يعني أن الوحدات الميتة هي القيد.
  • أعد التدريب من بذرة عشوائية مختلفة. فإذا استقر الاستواء عند خسارة مختلفة بوضوح، فللسطح أحواض متعددة.
  • تعمّد فرط التخصيص على دفعة واحدة. فإن عجز النموذج عن دفع الخسارة إلى ما يقارب الصفر على عشر عينات، فالمشكلة في السعة أو في خلل برمجي لا في التحسين.

متى تستخدم هذه التقنية

  • ينطبق هذا التشخيص حين تستوي خسارة التدريب فوق المستوى الذي ينبغي أن تبلغه المهمة بوضوح.
  • خسارة التحقق تتابع خسارة التدريب عن قرب — أي أن النموذج لا يفرط في التخصيص بل يعجز عن الملاءمة.
  • الاستواء نفسه يتكرر عبر البذور المختلفة، ما يشير إلى سبب منهجي لا إلى بداية غير موفقة.
  • البنية معروفة بكفايتها للمهمة، فالسعة ليست العامل المقيّد.

متى لا تستخدمها

  • خسارة التدريب تواصل الانخفاض بينما ترتفع خسارة التحقق — فذلك فرط تخصيص وينتمي إلى تشخيص آخر.
  • الاستواء يقع تمامًا عند المستوى الذي يحققه متنبئ الفئة الأكبر، وهو ما يشير إلى عدم توازن الفئات بدلًا من ذلك.
  • الخسارة تتذبذب بدل أن تستوي، وهو ما يدل على معدل تعلّم مرتفع جدًا لا منخفض.
  • النموذج يملك معاملات أقل مما تتطلبه المهمة؛ ولا يعوّض أي تغيير في التحسين عن نقص السعة.

القيود والمتطلبات المسبقة

  • في الشبكات عالية الأبعاد تكون الحدود الدنيا المحلية الحقيقية أقل شيوعًا بكثير مما توحي به شهرة المصطلح؛ ومعظم حالات التوقف شيء آخر.
  • لا توجد وسيلة عملية لإثبات أن نقطة ما حد أدنى عام لشبكة كبيرة، لذا تبقى عبارة «أفلتنا من الحد الأدنى المحلي» مؤقتة دائمًا.
  • إعادات التشغيل الدافئة تزيد زمن التدريب الإجمالي وقد تُلغي تقاربًا مفيدًا إذا طُبّقت بإفراط.
  • الزخم قد يحمل المُحسِّن متجاوزًا حلًّا جيدًا بالسهولة نفسها التي يتجاوز بها حلًّا سيئًا.

التمييز بين الأسباب الأربعة

تُنتج الأسباب الأربعة جميعها منحنى خسارة مستويًا. وأدوات القياس وحدها هي التي تفرّق بينها.

السببالبصمةالتدخّل
حد أدنى محليتدرّج قريب من الصفر وانحناء لأعلى ويتكرر عبر البذورتهيئة جديدة أو بنية أعرض
نقطة سرجتدرّج قريب من الصفر مع انحناء بعض الاتجاهات لأسفلالزخم وإعادات التشغيل الدافئة
معدل تعلّم متدهورتدرّجات سليمة ومعدل تعلّم قريب من الصفرتنقيح الجدولة أو إعادة تشغيل دافئة
وحدات ReLU ميتةنسبة كبيرة من التفعيلات تساوي صفرًا تمامًاإعادة التهيئة أو LeakyReLU أو خفض معدل التعلّم

التجهيز بالقياس يكلّف تشغيلة واحدة. أما التنقل بين المُحسِّنات عشوائيًا فيكلّف عدة تشغيلات ويتركك دون سبب.

الخلاصة

  • منحنى الخسارة المستوي عَرَض له أربعة أسباب شائعة تبدو متطابقة على المخطط.
  • معيار التدرّج ومعدل التعلّم ونسبة الوحدات الميتة تميّز بينها في تشغيلة واحدة مجهّزة بالقياس.
  • الحدود الدنيا المحلية الحقيقية أندر في الشبكات العميقة مما يوحي به المصطلح — اشتبه بالسروج والجدولة أولًا.
  • الزخم وإعادات التشغيل الدافئة أرخص التدخلات للمنطقة المستوية الحقيقية.
  • غيّر متغيرًا واحدًا في كل مرة، وإلا تعذّرت نسبة النتيجة إلى أي شيء.

الأسئلة الشائعة

أقل مما يوحي به المصطلح. ففي فضاءات المعاملات عالية الأبعاد يكون وجود نقطة ينحني عندها كل اتجاه لأعلى أمرًا غير مرجّح إحصائيًا؛ ومعظم حالات التوقف نقاط سرج أو معدلات تعلّم متدهورة أو وحدات ميتة.

بالانحناء. فعند السرج تبقى بعض الاتجاهات منحنية لأسفل، ويستطيع الزخم أو إعادة التشغيل الدافئة الإفلات. وعمليًا: إذا كسرت إعادات التشغيل الاستواء فلم يكن حدًّا أدنى.

لا. فـ Adam يكيّف أحجام الخطوات لكل معامل، وهو ما يساعد على عبور مناطق متفاوتة الانحناء، لكنه يتقارب إلى نقاط ثابتة كأي طريقة تدرّجية.

فقط بعد فحص الجدولة. فرفعه أثناء استواء حقيقي قد يساعد، لكن إن كان الاستواء ناتجًا عن وحدات ميتة فالمعدل الأعلى يقتل مزيدًا منها عادةً.

ليس إذا كان التدرّج صفرًا فعليًا. فالدورات الإضافية عند معدل تعلّم متلاشٍ لا تغيّر شيئًا وتستهلك المعالجة.

نعم. فهي تحدد موضع بدء التدريب على السطح، وتهيئة He أو Xavier المطابقة لدالة التفعيل تتجنب البدء في منطقة متشبّعة.

جدولة ترفع معدل التعلّم دوريًا بعد تدهوره، فتمنح المُحسِّن حجم خطوة كافيًا لمغادرة منطقة كان قد استقر فيها.

هل تستهلك عمليات التدريب الميزانية دون تحريك المؤشر؟

أرسل منحنى الخسارة وحجم الدفعة وإعدادات المُحسِّن ومواصفات العتاد، ونحدّد ما إذا كان القيد في التحسين أم البيانات أم قدرة المعالجة قبل طلب وحدات معالجة إضافية.

ناقش تحجيم خوادم الذكاء الاصطناعي

+971 56 404 6555 · info@swedishtechnology.com

المصادر والأدلة

  1. PyTorch: optimization — المرجع الرسمي للمُحسِّنات وجدولات معدل التعلّم بما فيها إعادات التشغيل الدافئة.
  2. Loshchilov & Hutter, SGDR (ICLR 2017) — الورقة التي قدّمت التخميد الجيبي مع إعادات التشغيل الدافئة.
  3. Dauphin et al., Saddle point problem (NeurIPS 2014) — أدلة على هيمنة نقاط السرج لا الحدود الدنيا المحلية على أسطح الخسارة عالية الأبعاد.
  4. TensorFlow: optimizers — المرجع الرسمي للمُحسِّنات والجدولات.

أسماء الموردين والمنتجات علامات تجارية لمالكيها؛ وتُستخدم المراجع للسياق التقني ولا تعني شراكة أو اعتمادًا أو تأييدًا ما لم يُذكر ذلك صراحة.