التعلم الفيدرالي المدعوم بالتوأم الرقمي لتدفقات البيانات
Digital Twin-Enabled Edge Federated Learning for Data Streams

شارك:
المجلة: Tsinghua Science & Technology، المجلد: 31، العدد: 4
DOI: https://doi.org/10.26599/tst.2024.9010227
تاريخ النشر: 2026-02-03
المؤلف: Zhenzhen Xie وآخرون
الموضوع الرئيسي: التقنيات التي تحافظ على الخصوصية في البيانات

نظرة عامة

تقدم البحث إطار عمل جديد لتعلم الفيدرالية المتدفق (SFL) الذي يعالج التحديات المرتبطة ببيانات البث المتغيرة زمنياً من مصادر متعددة. غالباً ما تتجاهل بروتوكولات SFL التقليدية قضايا مثل مشكلة بدء التشغيل البارد وبيانات التدريب غير الكافية، مما يمكن أن يؤدي إلى تدهور الأداء بسبب تباين العملاء والنسيان. للتخفيف من هذه التحديات، يقترح المؤلفون نظام SFL مدعوم بتوائم رقمية يستخدم الشبكات التنافسية التوليدية (GANs) لإنشاء نسخ افتراضية من كل عميل. تولد هذه التوائم الرقمية مجموعات بيانات اصطناعية بناءً على تدفقات البيانات الحقيقية، مما يسمح بالتدريب المستمر دون انتظار العملاء لتجميع بيانات كافية.

تظهر الدراسة أن الإطار المقترح يحافظ بفعالية على التزامن مع الظروف الفيزيائية بينما يوفر بيانات جديدة لخادم التعلم الفيدرالي. من خلال نشر توائم العملاء الرقمية على خوادم الحافة، يستفيد النظام من موارد حسابية إضافية لتعزيز بيانات التدريب عند الطلب، مما يعزز أداء النموذج ويعالج مخاوف الخصوصية. تشير النتائج التجريبية إلى أن هذا النهج يتفوق على الأساليب الحالية الرائدة في مختلف سيناريوهات تدفق البيانات وسلوكيات العملاء. تشمل اتجاهات البحث المستقبلية توسيع إطار SFL المدعوم بالتوائم الرقمية لمعالجة تحديات التعلم الفيدرالي المخصص.

مقدمة

تناقش مقدمة الورقة النمو السريع لإنترنت الأشياء (IoT)، الذي يضم حالياً حوالي 14.3 مليار نقطة نهاية نشطة. أدى هذا الانتشار إلى توليد مستمر للبيانات من مصادر متنوعة، بما في ذلك المركبات المستقلة والشبكات الذكية. استجابةً للقلق المتزايد بشأن الخصوصية المرتبطة بالبيانات التي تولدها الأجهزة المحمولة والصغيرة، يقترح المؤلفون نموذجاً جديداً يسمى تعلم الفيدرالية المتدفق (SFL). يهدف هذا النهج إلى تمكين التعلم الآلي التعاوني مع الحفاظ على الخصوصية عبر العديد من الأجهزة النهائية، مع التركيز على ثلاث ميزات رئيسية: حماية الخصوصية، بيانات البث، والتنفيذ عبر الحوسبة الطرفية متعددة الوصول (MEC).

على الرغم من التقدم، تواجه تطبيقات SFL الحالية تحديات كبيرة بسبب الافتراضات غير الواقعية المتعلقة ببيانات وظروف موارد عملاء التعلم الفيدرالي (FL). تحدد الورقة قضايا حرجة مثل عدم توازن موارد الحساب والاتصال، والتي يمكن أن تزعزع استقرار تدريب SFL. على سبيل المثال، يمكن أن تؤدي التغيرات في معدلات توليد البيانات بين العملاء إلى تدهور الأداء، خاصة عندما لا تتداخل توزيعات البيانات. بالإضافة إلى ذلك، فإن متطلبات تحميل العملاء لنماذجهم المحلية بالكامل تثير مخاوف بشأن الخصوصية، حيث تزيد من خطر تسرب التدرجات. كما تسلط الورقة الضوء على مشكلة النسيان الكارثي في نماذج التعلم عبر الإنترنت التقليدية المطبقة على SFL، حيث يمكن أن تكتب أنماط البيانات الجديدة فوق السابقة، مما يزيد من حدة التباين في البيانات والقيود المتعلقة بالخصوصية في FL. تؤكد هذه الملاحظات على الحاجة إلى حلول أكثر قوة تتماشى مع الظروف الواقعية وتعالج التحديات الموضحة.

طرق

في هذا القسم، يقدم المؤلفون إطار عمل جديد يدمج تقنية التوائم الرقمية (DT) مع التعلم الفيدرالي (FL) لمعالجة التحديات مثل تباين العملاء ونقص البيانات. يستخدم النظام المقترح الشبكات التنافسية التوليدية الشرطية (cGAN) لتوليد مجموعات بيانات اصطناعية تعزز تدفقات البيانات الحقيقية لكل عميل FL، مما يعزز عملية التدريب دون فرض تكاليف إضافية على العملاء الفرديين. لا يخفف هذا النهج من عدم توازن البيانات فحسب، بل يعالج أيضاً مشكلة النسيان الكارثي من خلال تمكين العملاء من إعادة تشغيل البيانات التاريخية جنباً إلى جنب مع تدفقات البيانات الجديدة، مما يسمح بالكشف عن أنماط جديدة مع الاحتفاظ بالمعرفة المكتسبة سابقاً.

علاوة على ذلك، يعزز الإطار حماية الخصوصية من خلال تجميع توائم العملاء على نفس خادم الحافة في عقدة فائقة، مما يسمح بالمشاركة التعاونية في مهام FL بينما يخفي البيانات الخام ومعلمات النموذج من هجمات تسرب التدرجات العميقة المحتملة. يتحقق المؤلفون من فعالية إطار عملهم من خلال تجارب واسعة النطاق على مجموعات بيانات عامة متنوعة، مما يظهر أداءً متفوقاً مقارنة بالأسس الرائدة عبر توزيعات العملاء المختلفة. ستتناول الأقسام التالية من الورقة الأبحاث ذات الصلة، والمفاهيم الأساسية، والمنهجية التفصيلية، والنتائج التجريبية.

نتائج

في هذا القسم، يقدم المؤلفون نتائج تجاربهم التي تقارن طريقتهم المقترحة، SFL_DT، مع ثلاث طرق معروفة للتعلم الفيدرالي (FL) – FedAvg و FedBN و FedProx – عبر ثلاث مجموعات بيانات: MNIST و FMNIST و CIFAR10. تضمنت التجارب 20 عميلاً يستخدمون تدفقات بيانات ديناميكية، حيث تغيرت فئة البيانات كل 20 جولة. تشير النتائج إلى أنه بينما تحافظ الأساليب الأساسية على دقة حوالي 90% على مجموعة بيانات MNIST، فإنها تواجه صعوبات مع البيانات الديناميكية، حيث تظهر انخفاضات كبيرة في الأداء على FMNIST (حوالي 69% دقة) و CIFAR10 (حوالي 43% دقة). بالمقابل، حقق SFL_DT دقة تبلغ 95.67% و 77.76% و 73.40% على مجموعات البيانات المعنية، مما يظهر تحسناً ملحوظاً مقارنة بالأسس.

تكشف التحليلات أيضاً أن الأساليب الأساسية تظهر تقلبات دورية في الدقة بسبب تغير فئات البيانات، وهو ما يتضح بشكل خاص في الجولات 40 و 80. تبرز هذه التقلبات ضعف قدرتها على التكيف مع التغيرات المفاجئة في توزيع البيانات، مما يؤدي إلى انخفاضات مؤقتة في الدقة. على العكس، يظهر SFL_DT قوة واستقرار أكبر عبر جميع مجموعات البيانات، مع تقلبات ذات سعة أصغر، مما يشير إلى قدرته على التكيف بسرعة مع توزيعات البيانات الجديدة والتخفيف من النسيان الكارثي. بشكل عام، تؤكد النتائج فعالية SFL_DT في التعامل مع تدفقات البيانات الديناميكية، متفوقاً على الأساليب التقليدية ويظهر قدرة تفوق في التكيف واستعادة الدقة.

نقاش

في هذا القسم، يستكشف المؤلفون الأدبيات المحيطة بتعلم الفيدرالية الاصطناعية (SFL)، والتوائم الرقمية (DT)، وتقنيات تعزيز البيانات، مع التركيز بشكل خاص على تطبيقها في بيئات الحوسبة الطرفية المتنقلة (MEC). يتميز SFL بتدريب نموذج لامركزي على تدفقات البيانات، حيث يتعاون العملاء لتعلم نموذج عالمي بينما يديرون تحديثات البيانات المحلية. يبرز المؤلفون التحديات الحالية في SFL، مثل افتراض أنماط البيانات المتسقة بين العملاء ومخاطر النسيان الكارثي، التي يمكن أن تؤدي إلى تدهور الأداء. يقترحون إطار عمل جديد لـ SFL يدمج طرق توليد البيانات الاصطناعية لمعالجة قضايا ندرة البيانات وعدم التوازن، مما يعزز كفاءة التدريب دون زيادة العبء على العملاء الفرديين.

يتناول النقاش أيضاً دور التوائم الرقمية، التي تعمل كنسخ رقمية للكيانات الفيزيائية، وإمكاناتها لتحسين إدارة الموارد في سياقات التعلم الفيدرالي. يشير المؤلفون إلى أنه على الرغم من استخدام التوائم الرقمية في تطبيقات FL المختلفة، إلا أن دمجها في SFL لا يزال غير مستكشف إلى حد كبير. من خلال بناء توائم العملاء على خوادم الحافة، يهدف الإطار المقترح إلى تحسين استخدام الموارد الحسابية وتسهيل تعزيز البيانات في الوقت الحقيقي. بالإضافة إلى ذلك، يقدم المؤلفون الشبكات التنافسية التوليدية (GANs) لتعزيز البيانات، مع التأكيد على فعاليتها في توليد بيانات اصطناعية لتخفيف عدم توازن الفئات وتعزيز أداء النموذج. تم تصميم الإطار للعمل بكفاءة في بيئات ديناميكية، مع معالجة التحديات مثل تباين معدلات وصول البيانات وسعات تخزين العملاء المحدودة، بهدف تحسين عملية التدريب العامة مع ضمان حماية الخصوصية.

Journal: Tsinghua Science & Technology, Volume: 31, Issue: 4
DOI: https://doi.org/10.26599/tst.2024.9010227
Publication Date: 2026-02-03
Author(s): Zhenzhen Xie et al.
Primary Topic: Privacy-Preserving Technologies in Data

Overview

The research presents a novel framework for Streaming Federated Learning (SFL) that addresses challenges associated with time-varying streaming data from multiple sources. Traditional SFL protocols often overlook issues such as the cold-start problem and insufficient training data, which can lead to performance degradation due to client heterogeneity and forgetting. To mitigate these challenges, the authors propose a digital twin-enabled SFL system that utilizes Generative Adversarial Networks (GANs) to create virtual replicas of each client. These digital twins generate synthetic datasets based on real data streams, allowing for continuous training without waiting for clients to accumulate sufficient data.

The study demonstrates that the proposed framework effectively maintains synchronization with physical conditions while providing fresh data to the federated learning server. By deploying client digital twins on edge servers, the system leverages additional computational resources to augment training data on demand, thereby enhancing model performance and addressing privacy concerns. Experimental results indicate that this approach outperforms existing state-of-the-art methods across various data stream scenarios and client behaviors. Future research directions include extending the digital twin-enabled SFL framework to tackle personalized federated learning challenges.

Introduction

The introduction of the paper discusses the rapid growth of the Internet of Things (IoT), which currently boasts approximately 14.3 billion active endpoints. This proliferation has led to a continuous generation of data from diverse sources, including autonomous vehicles and smart grids. In response to increasing privacy concerns associated with data generated by mobile and small devices, the authors propose a new paradigm called Streaming Federated Learning (SFL). This approach aims to enable privacy-preserving collaborative machine learning across numerous end devices, emphasizing three key features: privacy protection, streaming data, and implementation via Multi-access Edge Computing (MEC).

Despite advancements, existing SFL implementations face significant challenges due to unrealistic assumptions regarding data and resource conditions of Federated Learning (FL) clients. The paper identifies critical issues such as uneven computation and communication resources, which can destabilize SFL training. For instance, variations in data generation rates among clients can lead to performance degradation, particularly when data distributions do not overlap. Additionally, the requirement for clients to upload entire local models raises privacy concerns, as it increases the risk of gradient leakage. The paper also highlights the problem of catastrophic forgetting in traditional online learning models applied to SFL, where new data patterns can overwrite previous ones, exacerbated by the inherent data heterogeneity and privacy constraints in FL. These observations underscore the need for more robust solutions that align with real-world conditions and address the outlined challenges.

Methods

In this section, the authors introduce a novel framework that integrates Digital Twin (DT) technology with Federated Learning (FL) to address challenges such as client heterogeneity and data insufficiency. The proposed system utilizes conditional Generative Adversarial Networks (cGAN) to generate synthetic datasets that augment the real data streams of each FL client, thereby enhancing the training process without imposing additional costs on individual clients. This approach not only mitigates data imbalance but also addresses the catastrophic forgetting problem by enabling clients to replay historical data alongside new data streams, allowing for the detection of new patterns while retaining previously learned knowledge.

Furthermore, the framework enhances privacy protection by grouping client DTs on the same edge server into a supernode, which allows for collaborative participation in FL tasks while concealing raw data and model parameters from potential deep gradient leakage attacks. The authors validate the effectiveness of their framework through extensive experiments on various public datasets, demonstrating superior performance compared to state-of-the-art baselines across different client distributions. The subsequent sections of the paper will delve into related research, foundational concepts, detailed methodology, and experimental results.

Results

In this section, the authors present the results of their experiments comparing their proposed method, SFL_DT, with three established federated learning (FL) approaches—FedAvg, FedBN, and FedProx—across three datasets: MNIST, FMNIST, and CIFAR10. The experiments involved 20 clients using dynamic data streams, where the data class changed every 20 rounds. The results indicate that while baseline methods maintain around 90% accuracy on the MNIST dataset, they struggle with dynamic data, showing significant performance drops on FMNIST (around 69% accuracy) and CIFAR10 (approximately 43% accuracy). In contrast, SFL_DT achieved accuracies of 95.67%, 77.76%, and 73.40% on the respective datasets, demonstrating a marked improvement over the baselines.

The analysis further reveals that baseline methods exhibit periodic fluctuations in accuracy due to the changing data classes, particularly evident at rounds 40 and 80. These fluctuations highlight their poor adaptability to sudden changes in data distribution, resulting in temporary accuracy drops. Conversely, SFL_DT shows greater robustness and stability across all datasets, with smaller amplitude fluctuations, indicating its ability to quickly adjust to new data distributions and mitigate catastrophic forgetting. Overall, the findings validate the effectiveness of SFL_DT in handling dynamic data streams, outperforming traditional methods and showcasing superior adaptability and accuracy recovery.

Discussion

In this section, the authors explore the literature surrounding Synthetic Federated Learning (SFL), Digital Twins (DT), and data augmentation techniques, particularly focusing on their application in Mobile Edge Computing (MEC) environments. SFL is characterized by decentralized model training on data streams, where clients collaborate to learn a global model while managing local data updates. The authors highlight existing challenges in SFL, such as the assumption of consistent data patterns among clients and the risks of catastrophic forgetting, which can lead to performance degradation. They propose a novel SFL framework that integrates synthetic data generation methods to address issues of data sparsity and imbalance, thereby enhancing training efficiency without increasing the burden on individual clients.

The discussion also delves into the role of DTs, which serve as digital replicas of physical entities, and their potential to improve resource management in federated learning contexts. The authors note that while DTs have been utilized in various FL applications, their integration into SFL remains largely unexplored. By constructing client DTs on edge servers, the proposed framework aims to optimize computational resource utilization and facilitate real-time data augmentation. Additionally, the authors introduce Generative Adversarial Networks (GANs) for data augmentation, emphasizing their effectiveness in generating synthetic data to alleviate class imbalance and enhance model performance. The framework is designed to operate efficiently in dynamic environments, addressing challenges such as varying data arrival rates and limited client storage capacities, ultimately aiming to improve the overall training process while ensuring privacy protection.

شارك: