الأبحاث ضمن الموضوع : تطبيقات تعلم الآلة متعددة الوسائط
-
توليد محتوى إجرائي متعدد المهام باستخدام التعلم المعزز
2026 | المؤلف: Aylin Nekahdari وآخرون | المجلة: Scientific Reports | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)تقدم هذه الورقة إطار عمل جديد متعدد المهام يعتمد على اللغة لتوليد المحتوى الإجرائي من خلال التعلم المعزز (PCGRL)، مع التركيز على تعزيز التوافق الدلالي بين الأوامر اللغوية وميزات اللعبة الكمية. على عكس الطرق التقليدية التي تستخدم بشكل أساسي التكييف العددي، يستخدم الإطار المقترح مشفر DeBERTa جنبًا إلى جنب مع استراتيجية تدريب متعددة الأهداف تتضمن…
-
تعزيز تحديد المواقع الجغرافية لصور الفيضانات المستندة إلى الحشود عبر الانتباه الموجه بواسطة LLM
2026 | المؤلف: Fujun Xu وآخرون | المجلة: Computers Environment and Urban Systems | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)تقدم البحث VPR-AttLLM، وهو إطار عمل غير مرتبط بنموذج مصمم لتعزيز التعرف على الأماكن البصرية (VPR) في صور الشوارع المجمعة من الجمهور، خاصة خلال الأحداث الطارئة مثل الفيضانات الحضرية. تكافح نماذج VPR التقليدية مع التشوهات البصرية والتحولات في المجال الموجودة في مثل هذه الصور، وغالبًا ما تفتقر إلى بيانات جغرافية موثوقة للاستجابة الفعالة للطوارئ. يدمج…
-
التعلم المعزز متعدد الوكلاء الهرمي للإجابة على أسئلة الوثائق الصناعية المعززة بالاسترجاع
2026 | المؤلف: Yihong Qian وآخرون | المجلة: Scientific Reports | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)تقدم البحث MARL-RAGDoc، وهو إطار عمل تعليمي معزز متعدد الوكلاء هرمي يهدف إلى تحسين الاسترجاع المعزز بالتفكير المتعدد الوسائط في الوثائق الصناعية، التي تحتوي غالبًا على معلومات متنوعة عبر النصوص والصور والتنسيقات. تستخدم أطر العمل التقليدية للاسترجاع المعزز بالتوليد (RAG) عادةً طرق استرجاع ثابتة مع أوزان وسائط ثابتة وأعماق استرجاع موحدة، مما يؤدي إلى استرجاع…
-
من الهيكل إلى التآزر: مسح لتطور نموذج إدراك الرؤية واللغة في نماذج اللغة الكبيرة متعددة الوسائط
2026 | المؤلف: Haoxiang Sun وآخرون | المجلة: Information Fusion | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)يقدم هذا القسم من ورقة البحث استعراضًا منهجيًا للإدراك الموحد للرؤية واللغة في نماذج اللغة الكبيرة متعددة الوسائط (MLLMs)، معالجًا فجوة ملحوظة في الأدبيات حيث غالبًا ما تعالج المراجعات الحالية الرؤية واللغة ككيانات منفصلة. يعرف المؤلفون إدراك MLLM كقدرة متكاملة تشبه الإدراك البشري ويقدمون تصنيفًا من خمس مراحل يتتبع تطور نماذج الإدراك في MLLMs. يشمل…
-
إنسانية أكثر من اللازم للنمذجة: وادي الرعب لنماذج اللغة الكبيرة في محاكاة الأنظمة البشرية
2026 | المؤلف: Yongchao Zeng وآخرون | المجلة: npj Complexity | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)يتناول القسم الاستخدام المتزايد لنماذج اللغة الكبيرة (LLMs) في محاكاة السلوك البشري، مشددًا على قدرتها على توليد حوارات متماسكة تعزز الواقعية في النماذج. ومع ذلك، يجادل المؤلفون بأن هذا السعي نحو الواقعية يمكن أن يتعارض مع المبادئ الأساسية للنمذجة، لا سيما فيما يتعلق بالتجريد، والتبسيط، وقابلية التفسير. يحددون خمسة معضلات أساسية تنشأ عندما تصبح وكلاء…
-
تحديد المعلومات البصرية والأسئلة والأجوبة لموروثات التراث الثقافي غير المادي باستخدام إطار استرجاع الرسوم البيانية المعزز
2026 | المؤلف: Runzhou Wang وآخرون | المجلة: npj Heritage Science | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)يتناول قسم ورقة البحث تطوير إطار عمل لاسترجاع الرسوم البيانية يهدف إلى تعزيز التعرف واستخراج المعلومات من بطاقات العمل المرئية لموروثات الثقافة غير المادية (ICH). يجمع هذا الإطار بين الأساليب المعتمدة على الرسوم البيانية مع الجيل المعزز بالاسترجاع لتسهيل الفهم الدلالي والتفكير السياقي، مما يثري المحتوى الثقافي في النهاية. تم إنشاء مجموعة بيانات تضم بطاقات…
-
SurgRAW: سير العمل متعدد الوكلاء مع التفكير المتسلسل لتحليل الفيديو الجراحي الروبوتي
2026 | المؤلف: Chang Han Low وآخرون | المجلة: IEEE Robotics and Automation Letters | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)يقدم هذا القسم نظرة عامة على التقدم في جراحة الروبوت المدعومة (RAS) من خلال تقديم SurgCoTBench وSurgRAW. غالبًا ما تعتمد طرق الذكاء الاصطناعي الجراحية الحالية على نماذج معزولة، مما يؤدي إلى أساليب مجزأة ذات قابلية تفسير محدودة. لمعالجة هذه التحديات، تم تقديم SurgCoTBench كأول معيار يركز على التفكير في RAS، ويتكون من 14,256 زوج من…
-
استرجاع الاستشعار عن بعد المعزز بالتوليد: ربط صور الاستشعار عن بعد والمعرفة الشاملة مع مجموعة بيانات متعددة الوسائط ونموذج توليد معزز بالاسترجاع
2026 | المؤلف: Congcong Wen وآخرون | المجلة: IEEE Geoscience and Remote Sensing Magazine | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)تستعرض هذه القسم التقدمات الأخيرة في نماذج الرؤية-اللغة (VLMs) وتطبيقاتها في مهام الاستشعار عن بعد مثل وصف الصور، وفهم المشاهد، والإجابة على الأسئلة البصرية (VQA). بينما تركز نماذج VLMs الحالية للاستشعار عن بعد بشكل أساسي على فهم المشاهد المغلقة والوصف العام، فإنها غالبًا ما تفتقر إلى دمج المعرفة الخارجية، مما يحد من قدرتها على إجراء…
-
من اللغة إلى الفعل: مراجعة لنماذج اللغة الكبيرة كعملاء مستقلين ومستخدمي أدوات
2026 | المؤلف: Sadia Sultana Chowa وآخرون | المجلة: Artificial Intelligence Review | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)تقدم هذه القسم نظرة شاملة على التقدم في نماذج اللغة الكبيرة (LLMs) كعملاء مستقلين، مع التركيز على قدراتهم في اتخاذ القرار والتكيف. تركز المراجعة على الأدبيات المنشورة بين عامي 2023 و2025، وتتناول سبعة أسئلة بحثية رئيسية تتعلق بتصميم هيكلية عملاء LLM، والتي يتم تصنيفها إلى أنظمة عميل واحد وأنظمة متعددة العملاء. تستكشف الآليات المعرفية لـ…
-
نموذج أساسي للرؤية واللغة لتصوير الطب ثلاثي الأبعاد
2025 | المؤلف: Jing Wu وآخرون | المجلة: npj Artificial Intelligence | المجال: الرؤية الحاسوبية والتعرف على الأنماط (Computer Vision and Pattern Recognition)لقد أظهرت التطورات الأخيرة في الذكاء الاصطناعي، وخاصة في نماذج الأساس للرؤية واللغة (VLFMs)، إمكانات كبيرة لأتمتة توليد تقارير الأشعة من بيانات التصوير الطبي ثلاثي الأبعاد المعقدة. تستعرض هذه المراجعة النتائج من 23 دراسة، تفحص جوانب مختلفة مثل هياكل النماذج، والقدرات، ومجموعات بيانات التدريب، ومعايير التقييم. تسلط الضوء على تطور الذكاء الاصطناعي في مجال الأشعة…
