نموذج التعلم العميق المعزز لإدارة محفظة الأسهم بناءً على دمج البيانات
Deep Reinforcement Learning Model for Stock Portfolio Management Based on Data Fusion

المجلة: Neural Processing Letters، المجلد: 56، العدد: 2
DOI: https://doi.org/10.1007/s11063-024-11582-4
تاريخ النشر: 2024-03-17
المؤلف: Haifeng Li وآخرون
الموضوع الرئيسي: طرق التنبؤ بسوق الأسهم

نظرة عامة

تستكشف هذه الدراسة تطبيق التعلم المعزز العميق (DRL) لإدارة محافظ الأسهم، مع معالجة القيود التي تواجه الطرق التقليدية التي تعتمد بشكل أساسي على أسعار الأسهم في الوقت الحقيقي. من خلال دمج ميزات إضافية مثل المؤشرات المالية للأسهم واستخدام نظرية ماركويتز للمتوسط-التباين لارتباط الأسهم، طور المؤلفون نموذجًا ثلاثي الوكلاء يسمى نظام إدارة محافظ الأسهم القائم على التعلم المعزز متعدد الوكلاء التعاوني (CMPS). يستخدم كل وكيل شبكة Q عميقة لتحليل بيانات الأسهم الزمنية، بينما يدمج شبكة الانتباه الذاتي مخرجاتهم. تم تعزيز النموذج بشكل أكبر باستراتيجية الأصول الخالية من المخاطر، مما أدى إلى CMPS-Risk Free (CMPS-RF).

أظهرت النتائج التجريبية أن CMPS تفوقت على نماذج المعايير، محققة زيادة في العائد التراكمي (CuR) تزيد عن 6.8%. كما تميزت CMPS في تحديد فقاعات السوق والتخفيف من مخاطر انكماش الأصول. أظهر نموذج CMPS-RF، الذي يدمج الأصول الخالية من المخاطر، متانة فائقة، محققًا أعلى نسب شارب وكالمار السنوية جنبًا إلى جنب مع أدنى تقلب سنوي وأقصى انخفاض. تشير هذه النتائج إلى أن النماذج المقترحة يمكن أن تعزز بشكل كبير استراتيجيات الاستثمار من خلال الاستفادة من ميزات البيانات الشاملة وتقنيات إدارة المخاطر.

مقدمة

تستعرض مقدمة ورقة البحث تطور النظريات المالية وتطبيقاتها في إدارة المحافظ، بدءًا من تحليل المتوسط-التباين لهاري ماركويتز والتطوير اللاحق لنموذج تسعير الأصول الرأسمالية (CAPM) بواسطة شارب ولينتنر وموسين. لقد تقدمت فرضية السوق الفعالة (EMH)، التي اقترحها يوجين فاما، بفهم ديناميكيات السوق. تؤكد الورقة على الانتقال من النظريات المالية التقليدية إلى دمج التقنيات الحسابية الحديثة، لا سيما في سياق نماذج التداول الكمي. تسلط الضوء على أهمية تخصيص الأصول الديناميكي في إدارة المحافظ، حيث يقوم المستثمرون بتعديل نسب أصولهم استجابةً لتغيرات الأسعار في الوقت الحقيقي.

يقدم المؤلفون نموذجًا جديدًا للتعلم المعزز العميق متعدد الوكلاء (DRL)، يسمى نظام إدارة محافظ الأسهم القائم على التعلم المعزز متعدد الوكلاء التعاوني (CMPS). يدمج هذا النموذج ميزات المؤشر المالي والنظريات المالية التقليدية لتعزيز تعلم ارتباط الأصول. تشمل المساهمات الرئيسية تطوير هيكل DRL ثلاثي الوكلاء التعاوني الذي يستخدم شبكة Q عميقة (DQN) لاستخراج الميزات، وطريقة دمج البيانات التي تدمج التقارير المالية مع بيانات التداول في الوقت الحقيقي، واستراتيجية الأصول الخالية من المخاطر (CMPS-RF) المصممة للتخفيف من مخاطر الاستثمار خلال تقلبات السوق. تظهر النتائج التجريبية أن نموذج CMPS يتفوق على النماذج الحالية، لا سيما في تجنب المخاطر، كما يتضح من التقييمات باستخدام مجموعات بيانات من مؤشر شنغهاي للأوراق المالية (SSE) 50.

طرق

تناقش هذه القسم منهجيات مختلفة في التعلم المعزز العميق (DRL) وتطبيقاتها في إدارة المحافظ، مع تسليط الضوء على التقدم في هياكل شبكة الوكلاء وأنظمة الوكلاء المتعددة. لقد استغلت الدراسات الحديثة نماذج مثل المحولات والشبكات التلافيفية البيانية (GCNs) لتعزيز قدرات التعلم عند التعامل مع بيانات غير متجانسة. تشمل الأطر البارزة SARL، الذي يدمج ميزات الأخبار المالية، وDeepTrader، الذي يستخدم طبقة تلافيفية زمنية وآليات انتباه مكاني لتحسين ملفات المخاطر والعائد. بالإضافة إلى ذلك، تم استكشاف الأساليب متعددة الوكلاء، مثل نظام MAPS الذي يستخدم دالة خسارة عالمية لتشجيع اتخاذ قرارات متنوعة بين الوكلاء.

بعيدًا عن DRL، يتناول القسم أيضًا استراتيجيات إدارة المحافظ البديلة، بما في ذلك طرق الحساب التطوري للتحسين وتقنيات مبتكرة للتداول عالي التردد. طور الباحثون صيغ حساب دوران جديدة تحسن إدارة المخاطر واستراتيجيات الاستثمار، بينما أظهرت استراتيجيات التخفيف من المخاطر، مثل قيود الكاردينالية المدمجة مع الشبكات العصبية، أنها فعالة في خفض مستويات المخاطر مع تعزيز المكافآت المحتملة. بشكل عام، تمثل هذه المنهجيات خطوات كبيرة في معالجة تعقيدات اتخاذ القرارات المالية وإدارة المحافظ.

نقاش

في مناقشة إدارة المحافظ باستخدام التعلم المعزز (RL)، تصنف الورقة الأبحاث الحالية إلى نماذج قائمة على القيمة ونماذج قائمة على السياسة، مع تسليط الضوء على التقدم الذي تم تحقيقه من خلال التعلم العميق، ودمج الميزات الإضافية، وأنظمة الوكلاء المتعددة. يتم تقديم نظرة شاملة على النماذج المتطورة في الجدول 1، الذي يوضح مختلف الأساليب مثل FRDNN وEIIE وDDPG، من بين آخرين. تظهر هذه النماذج تحسينات كبيرة في العوائد ونسب شارب عبر أسواق مختلفة، بما في ذلك الأسهم والعملات المشفرة. على سبيل المثال، حقق نموذج EIIE أربعة أضعاف الإيرادات في سوق العملات المشفرة خلال 30 يومًا، بينما تفوقت استراتيجية Ensemble على الطرق التقليدية في سوق الأسهم الأمريكية.

تتوسع الورقة في تطور خوارزميات RL، مع التأكيد على الانتقال من التعلم المعزز التكراري (RRL) إلى طرق التعلم المعزز العميق (DRL). تشمل المساهمات البارزة إدخال آليات الانتباه الذاتي في AlphaStock لنمذجة العلاقات بين الأصول واستخدام هياكل الشبكات العصبية المختلفة لتعزيز استخراج الميزات وعمليات اتخاذ القرار. يُقترح نموذج CMPS، الذي يستخدم إطار عمل ثلاثي الوكلاء لدمج أسعار السوق، والمؤشرات المالية، وارتباطات الأسهم، كنموذج جديد لتحسين إدارة المحافظ. يسمح تصميم النموذج بتحليل شامل لكل من الاتجاهات الاقتصادية الدقيقة والكلية، بهدف تحقيق أقصى عائد تراكمي من خلال عملية تدريب منظمة تعتمد على خوارزمية DQN.

Journal: Neural Processing Letters, Volume: 56, Issue: 2
DOI: https://doi.org/10.1007/s11063-024-11582-4
Publication Date: 2024-03-17
Author(s): Haifeng Li et al.
Primary Topic: Stock Market Forecasting Methods

Overview

This study investigates the application of deep reinforcement learning (DRL) for stock portfolio management, addressing limitations of traditional methods that primarily rely on real-time stock quotes. By incorporating additional features such as stock financial indices and utilizing Markowitz mean-variance theory for stock correlation, the authors developed a three-agent model named Collaborative Multi-agent reinforcement learning-based stock Portfolio management System (CMPS). Each agent employs a deep Q-network to analyze time-series stock data, while a self-attention network integrates their outputs. The model was further enhanced with a risk-free asset strategy, resulting in CMPS-Risk Free (CMPS-RF).

Experimental results demonstrated that CMPS outperformed benchmark models, achieving a cumulative return (CuR) increase of over 6.8%. CMPS also excelled in identifying market bubbles and mitigating asset shrinkage risks. The CMPS-RF model, which incorporates risk-free assets, exhibited superior robustness, achieving the highest annualized Sharpe and Calmar ratios alongside the lowest annualized volatility and maximum drawdown. These findings suggest that the proposed models can significantly enhance investment strategies by leveraging comprehensive data features and risk management techniques.

Introduction

The introduction of the research paper outlines the evolution of financial theories and their application in portfolio management, starting with Harry Markowitz’s Mean-Variance Analysis and the subsequent development of the Capital Asset Pricing Model (CAPM) by Sharpe, Lintner, and Mossin. The Efficient Market Hypothesis (EMH), proposed by Eugene Fama, further advanced the understanding of market dynamics. The paper emphasizes the transition from traditional financial theories to the integration of modern computational techniques, particularly in the context of quantitative trading models. It highlights the importance of dynamic asset allocation in portfolio management, where investors adjust their asset proportions in response to real-time price changes.

The authors introduce a novel multi-agent deep reinforcement learning (DRL) model, termed the Collaborative Multi-agent reinforcement learning-based stock Portfolio management System (CMPS). This model incorporates financial index features and traditional financial theories to enhance asset correlation learning. Key contributions include the development of a collaborative three-agent DRL structure that utilizes a deep Q-network (DQN) for feature extraction, a data fusion method that integrates financial reports with real-time trading data, and a risk-free asset strategy (CMPS-RF) designed to mitigate investment risks during market fluctuations. Experimental results demonstrate that the CMPS model outperforms existing models, particularly in risk avoidance, as evidenced by evaluations using datasets from the China Shanghai Stock Exchange (SSE) 50 Index.

Methods

The section discusses various methodologies in Deep Reinforcement Learning (DRL) and their applications in portfolio management, highlighting advancements in agent network structures and multi-agent systems. Recent studies have leveraged models like Transformers and Graph Convolutional Networks (GCNs) to enhance learning capabilities when dealing with heterogeneous data. Notable frameworks include SARL, which integrates financial news features, and DeepTrader, which employs a temporal convolution layer and spatial attention mechanisms to optimize risk-return profiles. Additionally, multi-agent approaches have been explored, such as the MAPS system that utilizes a global loss function to encourage diverse decision-making among agents.

Beyond DRL, the section also addresses alternative portfolio management strategies, including evolutionary computation methods for optimization and innovative techniques for high-frequency trading. Researchers have developed novel turnover calculation formulas that improve risk management and investment strategies, while risk mitigation strategies, such as cardinality restrictions combined with neural networks, have been shown to effectively lower risk levels while enhancing potential rewards. Overall, these methodologies represent significant strides in addressing the complexities of financial decision-making and portfolio management.

Discussion

In the discussion of portfolio management using reinforcement learning (RL), the paper categorizes existing research into value-based and policy-based models, highlighting advancements achieved through deep learning, additional feature incorporation, and multi-agent systems. A comprehensive overview of state-of-the-art models is presented in Table 1, which details various approaches such as FRDNN, EIIE, and DDPG, among others. These models demonstrate significant improvements in returns and Sharpe ratios across different markets, including stocks and cryptocurrencies. For instance, the EIIE model achieved four times the revenue in the cryptocurrency market within 30 days, while the Ensemble strategy outperformed traditional methods in the US stock market.

The paper further elaborates on the evolution of RL algorithms, emphasizing the transition from recursive reinforcement learning (RRL) to deep reinforcement learning (DRL) methods. Notable contributions include the introduction of self-attention mechanisms in AlphaStock to model asset interrelationships and the use of various neural network architectures to enhance feature extraction and decision-making processes. The CMPS model, which utilizes a three-agent framework to integrate market quotes, financial indices, and stock correlations, is proposed as a novel approach to optimize portfolio management. The model’s design allows for a comprehensive analysis of both micro and macroeconomic trends, ultimately aiming to maximize cumulative returns through a structured training process based on the DQN algorithm.