في هذه المناطق التطبيقية، غالباً ما يتم تنفيذ التخزين كمرشح يحول الإشارات والبيكسلات إلى قيم أكثر رغبة.
في الحوسبة عالية الأداء، غالبا ما يشار إلى نمط التخزين باسم الحوسبة القصص. عادة ما يتضمن التخفيف عددًا كبيرًا من العمليات الحسابية على كل عنصر بيانات. يمكن حساب كل عنصر بيانات الخروج بشكل مستقل عن بعضهما البعض، وهي سمة مرغوب فيها للحوسبة الموازية. من ناحية أخرى، هناك مستوى كبير من تبادل البيانات المدخلة بين عناصر البيانات المخرجة مع ظروف حدودية صعبة إلى حد ما. وهذا يجعل التخزين حالة استخدام مهمة لطرق التخزين المتطورة وأساليب تخزين البيانات المدخلة.
التناغم هو عملية صف حيث كل عنصر بيانات الخروج هو مبلغ موازن من مجموعة من عناصر المدخلات المجاورة. يتم تعريف الأوزان المستخدمة في حساب المبلغ الموزن بواسطة صفة قناع المدخل، والتي يشار إليها عادة باسم جوهر التخزين. سنشار إلى هذه المجموعات من الأقنعة باسم أقنعة التخزين. نفس قناع التخزين يستخدم عادة لجميع عناصر المجموعة
فيما يلي مثال على التخزين للبيانات 1D حيث يتم تطبيق صفة قناع التخزين 5 عناصر M على صفة مدخل 7 عناصر N.
لمعالجة الصور ورؤية الكمبيوتر، تكون بيانات المدخل عادةً صفوف بعملية اثنتين، مع البيكسلات في مساحة x-y. لذا فإن تحوّل الصورة هو تحوّل ثنائي الأبعاد. لا يجب أن يكون القناع مربعاً.
1\ من التحوّل الأبعاد الأول إلى الأبعاد الثانية
أنت تعرف التحول الاولى
- المدخول: صف 1D (مثل:
[x0, x1, x2, ...]) - النياز: صف صغير 1D (مثل:
[w0, w1, w2]) - ** العملية:** انزلع النجم وتأخذ المبالغ الموزعة.
بالنسبة لـ ** الصور**، فإن المدخل هو 2D (الارتفاع × الاحضار) ، لذلك:
- المدخول: ماتريك البيكسلات، شكل
H × W - النيزك: المصفوفة الصغيرة، على سبيل المثال
3 × 3أو5 × 5 - ** العملية:** وضع النواة على كل
3 × 3المقطوعة من الصورة، ضرب العنصر على نحو صحيح، جمع → بيكسل خروجي واحد.
هذه نفس الفكرة التي تعرفها بالفعل، لكن:
- صف → صف 2D (المصفوفة).
- الجوار عناصر → البيكسلات الجوارية في 2D.
2\ قنوات متعددة (مثل RGB)
الصور الحقيقية ليست مجرد 2D، فهي غالباً ما تمتلك قنوات:
- الشكل:
H × W × C(على سبيل المثال ،C = 3لـ R ، G ، B). - ثم كربون أيضا عنده عمق
C:- الشكل:
kH × kW × C.
- الشكل:
خطوة التحول:
- للوضع الواحد، تأخذ مكعب صغير:
kH × kW × C. - مضاعفة العنصر مع النواة
kH × kW × C. - جمع جميع القيم → 1 رقم (قيمة قناة خروج واحدة في ذلك الموقع).
لذا فمن الناحية الفكرية: ** تناولت ثلاثية الأبعاد عبر الفضاء + القنوات**، ولكن لا يزال فقط الموزن المجموع من الجيران.
3\ المصفحات (النيازات) و خرائط الميزات
في سي إن إن، لا تستخدمين فقط نجمة واحدة، تستخدمين ** العديد **:
- لنفترض أنك تستخدم
Fمختلفة - كل جوهر له شكل
kH × kW × C_in. - كل جوهر ينتج ** قناة خروج واحدة **، تسمى خريطة ** الميزات **.
إذا كان شكل المدخل هو:
H × W × C_in،
و تستخدمين " F " الأجزاء، تصبح شكل الخروج:
H_out × W_out × F.
كل من هذه القنوات الخارجة F تلتقط نوعا مختلفا من النمط:
- قد تتعلم إحدى الأجزاء الكهربائية اكتشاف ** الحواف**، والآخر ** الزوايا**، والآخر ** التركيبات**، إلخ.
فكر: طبقة CNN = تطبيق العديد من التشويشات المختلفة (الفلترات) على المدخل.
4\ الدرجة الأولى
تفاصيل أخرى ذات صلة بالصف:
- ** خطوة:** إلى أي مدى تحركين النواة كل خطوة.
- الخطوة الأولى: تحريك بيكسل واحد في كل مرة → خروج كثيفة.
- الخطوة الثانية: تخطي كل بيكسل آخر → خروج أصغر.
- الملع: إضافة الصفر حول الحدود من الصورة.
- بدون التغطية، يصبح الإنتاج أصغر
- مع التدليك، يمكنك الحفاظ على نفس الارتفاع/الربع.
رياضياً، ما زال الأمر مجرد نسق النوافذ ومنتجات النقاط، ولكن مع السيطرة على:
- إلى أي مدى تتسلّل (تسلّط)
- إذا كنت تفقد معلومات الحدود (التمهيد).
5\ عدم الخطية: إضافة وظائف التفعيل
حتى الآن كل شيء خطي: مبالغ معززة. طبقة CNN تضيف ** عدم الخيارات الحددية**:
- بعد التخفيف، قم بتطبيق وظيفة تفعيل على النحو العنصري (مثل: `ReLU(x) = ماكسب 0، x)
إذاً طبقة واحدة من القيود هي:
- التخفيف (المبالغ الموزعة خطيا).
- التفعيل (غير خطي).
هذه الجمعية تسمح لـ"سي إن إن" بالتعلم عن خرائط معقدة غير خطية.
6\ طبقات التجميع → hierarchies من الميزات العميقة
CNN كاملة هي فقط ** العديد من الطبقات ** من:
- التحول → التفعيل (→ أحيانا التجمع).
الحس:
- ** الطبقات المبكرة**: اكتشاف الأشياء البسيطة (الحواف، البقع).
- ** الطبقات الوسطى**: مزجها إلى نسيج أو شكل.
- ** الطبقات اللاحقة**: الجمع بين الأشكال إلى أجزاء وقطع الأشياء.
كل هذا ما زال مبنيًا من نفس البدائية التي تفهمها: خذ الحي المحلي وحسب المبالغ الموزعة.
7\ اتصال مع طبقات متصلة بالكامل (كثيفة)
طبقة متصلة بالكامل هي أيضا مجرد مبالغ معززة:
- المدخل: متجه 1D.
- وحدة الخروج = جمع (الوزن × المدخل) + التحيز.
الفرق:
- طبقة كثيفة: كل وحدة خروجه تستخدم ** جميع** عناصر المدخل.
- طبقة Conv: كل وحدة خروج تستخدم فقط ** محيط محلي** (الربط المتباين) و ** يشارك الوزن** عبر المواقع.
لذا يمكنك أن ترى سي إن إن مثل:
- طريقة ذكية لاستخدام عملية التخزين الخاصة بك للحصول على:
- الوضع المحلي (البيكسلات القريبة هي أكثر أهمية).
- مشاركة الوزن (النيز نفسه في جميع المواقع).
- معايير أقل من طبقة كثيفة على الصور الكاملة.
الاستنتاج: من عملية بسيطة إلى شبكات قوية
"At each position, take neighbors and compute a weighted sum with a kernel,"
إذاً أنت تقف بالفعل على فكرة الأساسية وراء سي إن إن
سي إن إن تأخذ هذه البنية البسيطة و:
- تمدّد من المصفوفات الأبعادية إلى الجهازات الجهازية الأبعاد الثلاثية الأبعاد
- تطبيق العديد من الأجزاء المختلفة بالتوازي لإنتاج خرائط الميزات الغنية.
- إضافة غير خطية لتجنب خطية نقية.
- قم بتجميع العديد من هذه الطبقات بحيث تظهر كل مرحلة بنية أكثر تجريدية.
سحرية سي إن إن ليست نوعاً جديداً من الرياضيات بل تركيب العديد من العمليات الصغيرة المحلية المتحركة إلى بنية عميقة يمكنها تعلم التمثيلات البصرية القوية.