تخطى إلى المحتوى
العالِم العربي
  • الصفحة الرئيسية
  • مجالات الأبحاث
  • عن الموقع
  • تواصل معنا
  1. الرئيسية
  2. قائمة الموضوعات الرئيسية
  3. تطبيقات تعلم الآلة متعددة الوسائط

الأبحاث ضمن الموضوع : تطبيقات تعلم الآلة متعددة الوسائط




  • تعزيز تحديد المواقع الجغرافية لصور الفيضانات المستندة إلى الحشود عبر الانتباه الموجه بواسطة LLM

    2026 | المؤلف: Fujun Xu وآخرون | المجلة: Computers Environment and Urban Systems | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)

    تقدم البحث VPR-AttLLM، وهو إطار عمل غير مرتبط بنموذج مصمم لتعزيز التعرف على الأماكن البصرية (VPR) في صور الشوارع المجمعة من الجمهور، خاصة خلال الأحداث الطارئة مثل الفيضانات الحضرية. تكافح نماذج VPR التقليدية مع التشوهات البصرية والتحولات في المجال الموجودة في مثل هذه الصور، وغالبًا ما تفتقر إلى بيانات جغرافية موثوقة للاستجابة الفعالة للطوارئ. يدمج…


  • SurgRAW: سير العمل متعدد الوكلاء مع التفكير المتسلسل لتحليل الفيديو الجراحي الروبوتي

    2026 | المؤلف: Chang Han Low وآخرون | المجلة: IEEE Robotics and Automation Letters | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)

    يقدم هذا القسم نظرة عامة على التقدم في جراحة الروبوت المدعومة (RAS) من خلال تقديم SurgCoTBench وSurgRAW. غالبًا ما تعتمد طرق الذكاء الاصطناعي الجراحية الحالية على نماذج معزولة، مما يؤدي إلى أساليب مجزأة ذات قابلية تفسير محدودة. لمعالجة هذه التحديات، تم تقديم SurgCoTBench كأول معيار يركز على التفكير في RAS، ويتكون من 14,256 زوج من…


  • استرجاع الاستشعار عن بعد المعزز بالتوليد: ربط صور الاستشعار عن بعد والمعرفة الشاملة مع مجموعة بيانات متعددة الوسائط ونموذج توليد معزز بالاسترجاع

    2026 | المؤلف: Congcong Wen وآخرون | المجلة: IEEE Geoscience and Remote Sensing Magazine | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)

    تستعرض هذه القسم التقدمات الأخيرة في نماذج الرؤية-اللغة (VLMs) وتطبيقاتها في مهام الاستشعار عن بعد مثل وصف الصور، وفهم المشاهد، والإجابة على الأسئلة البصرية (VQA). بينما تركز نماذج VLMs الحالية للاستشعار عن بعد بشكل أساسي على فهم المشاهد المغلقة والوصف العام، فإنها غالبًا ما تفتقر إلى دمج المعرفة الخارجية، مما يحد من قدرتها على إجراء…


  • من اللغة إلى الفعل: مراجعة لنماذج اللغة الكبيرة كعملاء مستقلين ومستخدمي أدوات

    2026 | المؤلف: Sadia Sultana Chowa وآخرون | المجلة: Artificial Intelligence Review | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)

    تقدم هذه القسم نظرة شاملة على التقدم في نماذج اللغة الكبيرة (LLMs) كعملاء مستقلين، مع التركيز على قدراتهم في اتخاذ القرار والتكيف. تركز المراجعة على الأدبيات المنشورة بين عامي 2023 و2025، وتتناول سبعة أسئلة بحثية رئيسية تتعلق بتصميم هيكلية عملاء LLM، والتي يتم تصنيفها إلى أنظمة عميل واحد وأنظمة متعددة العملاء. تستكشف الآليات المعرفية لـ…


  • الشعر الذي تم إنشاؤه بواسطة الذكاء الاصطناعي لا يمكن تمييزه عن الشعر المكتوب بواسطة البشر ويُقيَّم بشكل أكثر إيجابية

    2024 | المؤلف: Brian Porter وآخرون | المجلة: Scientific Reports | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)

    تستكشف هذه الدراسة قدرة القراء غير الخبراء على التمييز بين القصائد التي تم إنشاؤها بواسطة الذكاء الاصطناعي وتلك التي كتبها شعراء بشريون مشهورون. من خلال تجربتين شملت ما مجموعه 16,340 مشاركًا، كشفت النتائج أن القراء أدوا دون مستويات الصدفة، محققين دقة تبلغ 46.6% فقط في تحديد المحتوى الذي تم إنشاؤه بواسطة الذكاء الاصطناعي (χ²(1, N…


  • شبكة تفاعل واعية بالسياق لتقسيم دلالات RGB-T

    2024 | المؤلف: Ying Lv وآخرون | المجلة: IEEE Transactions on Multimedia | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)

    تقدم ورقة البحث شبكة التفاعل المدركة للسياق (CAINet) لتقسيم الدلالات RGB-T، مع معالجة القيود الموجودة في الأساليب الحالية في الاستفادة الفعالة من العلاقات التكميلية بين الأنماط المختلفة. تقوم CAINet ببناء مساحة تفاعل تستخدم المهام المساعدة والسياق العالمي لتسهيل التعلم الموجه بشكل صريح. تشمل المكونات الرئيسية لـ CAINet وحدة التفكير التكاملي المدرك للسياق (CACR)، التي تؤسس…


حقوق النشر © 2026 العالِم العربي. جميع الحقوق محفوظة. موقع العالِم العربي غير مسؤول عن محتوى المواقع الخارجية.