نظام RAG (استرجاع معزز بالتوليد) مفتوح المصدر يعتمد على لقطات شاشة المواقع بدلاً من تحليل HTML، باستخدام نماذج الرؤية واللغة (Vision-Language) لفهم الصفحات بصرياً والحفاظ على المعلومات البصرية المفقودة في النصوص، مع فهرس جاهز لأكثر من 8 ملايين صفحة من ويكيبيديا.
المشروع جديد (تم نشر الورقة البحثية في 2026). قد تتغير واجهات برمجة التطبيقات والميزات في الإصدارات المستقبلية.
ملاحظة
يتطلب تشغيل الفهرس الكامل لويكيبيديا مساحة تخزين كبيرة (~217 جيجابايت).
نبذة عن PixelRAG
PixelRAG هو مشروع مفتوح المصدر من جامعة بيركلي (Berkeley SkyLab و BAIR) يقدم نهجاً جديداً لأنظمة RAG (Retrieval-Augmented Generation) من خلال التعامل مع صفحات الويب والمستندات كصور بدلاً من نصوص HTML، مما يحافظ على المعلومات البصرية مثل الجداول والرسوم البيانية والتخطيطات التي تفقد عند استخراج النصوص التقليدي.[reference:0][reference:1]
يعتمد النظام على نموذج Qwen3-VL-Embedding المُحسَّن بتقنية LoRA على بيانات لقطات الشاشة لإنشاء تمثيلات بصرية للمحتوى، ثم يبني فهرساً باستخدام FAISS أو Qdrant للبحث السريع.[reference:2][reference:3]
يدعم PixelRAG معالجة صفحات الويب، وملفات PDF، والصور، ويوفر واجهة برمجة تطبيقات HTTP للبحث، بالإضافة إلى إضافة لـ Claude Code (مهارة pixelbrowse) تمكن الوكيل من “رؤية” الصفحات كصور بدلاً من قراءة HTML.[reference:4][reference:5]
يتوفر فهرس جاهز لأكثر من 8.28 مليون صفحة من ويكيبيديا يمكن الوصول إليه عبر واجهة برمجة تطبيقات عامة دون الحاجة إلى إعداد أو مفتاح API.[reference:6] يمكن تثبيت النظام عبر pip وتشغيله محلياً على macOS (Apple Silicon) أو Linux (CUDA) أو حتى على وحدات المعالجة المركزية.[reference:7]
✓
إضافة Claude Code تمكن وكلاء الذكاء الاصطناعي من رؤية الصفحات كصور
✓
فهرس جاهز لأكثر من 8.28 مليون صفحة من ويكيبيديا مع واجهة برمجة تطبيقات عامة مجانية
✓
مفتوح المصدر بالكامل مع ورقة بحثية أكاديمية محكمة
✓
نشر مرن: ملف ثنائي واحد، أو Docker، أو واجهة برمجة تطبيقات سحابية
✓
يعمل محلياً على macOS (Apple Silicon) و Linux (CUDA) وحتى على وحدات المعالجة المركزية
✓
يقوم بفهرسة المحتوى البصري (الجداول، الرسوم البيانية، التخطيطات) التي تفقد في استخراج النصوص التقليدي
العيوب
✗
الفهرس الكامل لويكيبيديا (~217 جيجابايت) كبير الحجم
✗
دعم اللغة العربية غير متوفر حالياً
✗
مشروع جديد (2026) قد تكون بعض الميزات غير مستقرة بعد
✗
يتطلب موارد حاسوبية أعلى من أنظمة RAG النصية بسبب معالجة الصور
أسئلة شائعة عن PixelRAG
هذه الأسئلة الأكثر طرحا حول PixelRAG
تعتمد أنظمة RAG النصية على استخراج النصوص من HTML، مما يفقد المعلومات البصرية مثل الجداول والرسوم البيانية والتخطيطات. PixelRAG يحول الصفحات إلى لقطات شاشة ويستخدم نماذج رؤية ولغة لفهم المحتوى بصرياً، مما يحافظ على جميع المعلومات البصرية ويحسن دقة الإجابات على الأسئلة التي تتطلب فهماً للمخططات والجداول.[reference:8][reference:9]
يتطلب PixelRAG Python 3.10+ ويمكن تشغيله على macOS (Apple Silicon) أو Linux (مع CUDA للتعجيل) أو حتى على وحدات المعالجة المركزية فقط. يتم التثبيت عبر pip مع خيارات مختلفة حسب الحاجة (مثل `pip install ‘pixelrag[serve]’` للبحث، أو `pip install ‘pixelrag[index]’` لبناء الفهارس).[reference:10][reference:11]
نعم، يدعم PixelRAG فهرسة المستندات المحلية بما في ذلك ملفات PDF والصور وصفحات الويب. يمكنك بناء فهرس مخصص باستخدام الأمر `pixelrag index build` مع ملف تهيئة YAML يحدد مصدر المستندات ونموذج التضمين. يدعم النظام العمل على macOS و Linux.[reference:12][reference:13]
نعم، يوفر PixelRAG واجهة برمجة تطبيقات عامة على `https://api.pixelrag.ai` مع فهرس جاهز لأكثر من 8.28 مليون صفحة من ويكيبيديا. يمكن استخدامها دون الحاجة إلى إعداد أو مفتاح API، وتدعم البحث النصي والبحث البصري (رفع صورة كاستعلام).[reference:14]
لا، PixelRAG هو مشروع أكاديمي مفتوح المصدر من جامعة بيركلي (الولايات المتحدة). لا توجد أي معلومات تشير إلى أن المشروع أو مطوريه لهم أي ارتباط بإسرائيل. بناءً على المعلومات المتاحة، لا يخضع PixelRAG للمقاطعة.
مساعد ذكاء اصطناعي صيني متقدم ومجموعة نماذج مفتوحة المصدر من Moonshot AI، مصمم للمهام المعقدة والبرمجة والتفكير طويل الأمد، مع قدرات فريدة في تنسيق مجموعات من الوكلاء (Agent Swarms).
إطار عمل مفتوح المصدر لوكيل ذكاء اصطناعي مستقل، صُمم ليكون 'وكيلاً يتعلم ويتطور معك'، قادر على تنفيذ مهام حقيقية عبر منصات متعددة ويتعلم من الخبرة ليصبح أكثر كفاءة بمرور الوقت.
تطبيق بحثي متخصص لتشغيل نماذج الذكاء الاصطناعي باستخدام تقنية 'المزيج من الخبراء' (Mixture-of-Experts) محلياً على أجهزة Apple الحديثة (iPhone 15 Pro وما فوق)، موجه للمطورين والباحثين، ومفتوح المصدر بالكامل.
تطبيق محادثة ذكية محلي بالكامل، يدعم النصوص والصوت وتحليل الصور والملفات دون اتصال بالإنترنت، مع واجهة مستخدم بسيطة تشبه أدوات الدردشة المعروفة، واعتماد على نماذج Gemma و Qwen و DeepSeek و LLaMA.
تطبيق محادثة ذكي محلي وقوي، يقدم تجربة مكالمات صوتية وتحليل صور وملفات دون اتصال بالإنترنت، مع واجهة بسيطة واعتماد على نماذج متقدمة مصممة للتشغيل المحلي.
تطبيق رسمي من جوجل لتشغيل نماذج الذكاء الاصطناعي مفتوحة المصدر محلياً على الأجهزة المحمولة دون اتصال بالإنترنت، مع دعم تحليل الصور والمحادثة وتحرير النصوص، وهو متاح مجاناً على GitHub.
تطبيق مفتوح المصدر لتشغيل نماذج الذكاء الاصطناعي محلياً على هواتف Android و iOS دون اتصال بالإنترنت، مع إمكانية تحميل نماذج من Hugging Face، والتحكم الكامل بإعدادات الأداء لتحقيق التوازن بين السرعة واستهلاك البطارية.
وكيل مبيعات ذكي يعمل بالذكاء الاصطناعي (AI Sales Agent) لمتاجر WooCommerce، يساعد في تحويل الزوار إلى عملاء من خلال الإجابة على الأسئلة، والتوصية بالمنتجات، وتوجيه المشترين، وتقليل معدلات التخلي عن السلة، من خلال محادثة تفاعلية داخل المتجر.
بديل مفتوح المصدر ومحلي بالكامل لـ ElevenLabs، يوفر استنساخ الصوت من عينة 3 ثوانٍ، دبلجة الفيديو السينمائية، الإملاء الفوري، وعزل الصوت، كل ذلك دون اتصال بالإنترنت أو رسوم اشتراك، ويدعم 646 لغة.
مساعد بحثي مفتوح المصدر وقابل للاستضافة الذاتية، يُعد بديلاً خاصاً ومرناً لـ Google NotebookLM. يتيح لك تنظيم المواد، والتفاعل مع مستنداتك عبر محادثة مدعومة بالذكاء الاصطناعي، وإنشاء ملخصات وحتى بودكاست متعدد المتحدثين، مع الحفاظ على خصوصية بياناتك الكاملة.
نظام ملفات ذاتي التنظيم، يعتمد على نموذج Llama 3 (عبر Groq أو Ollama) لإعادة تسمية وتنظيم الملفات بناءً على محتواها، مع وضعي تشغيل: دفعة (batch) ومراقبة (watch) للتعلم من تعديلات المستخدم.
منصة سحابية تقدم نماذج ذكاء اصطناعي متطورة، أبرزها نظام Fugu الذي ينسق بين نماذج متعددة لأداء مهام معقدة ومتعددة الخطوات عبر واجهة برمجة تطبيقات واحدة متوافقة مع OpenAI، مع التركيز على المرونة وتجنب الاعتماد على بائع واحد.
استوديو إبداعي مفتوح المصدر يعمل بالذكاء الاصطناعي، يوفر أكثر من 200 نموذج لتوليد الصور والفيديو والسينما والمقاطع القصيرة ومزامنة الشفاه، مدعوم بمفتاح MuAPI، مع واجهة نظيفة وإمكانية التشغيل كتطبيق سطح مكتب.
مساحة عمل ذكاء اصطناعي مجانية ومفتوحة المصدر، قابلة للاستضافة الذاتية، مصممة لتكون بديلاً محلياً لـ ChatGPT وClaude، مع التركيز على الخصوصية والتحكم الكامل في البيانات.
خادم MCP (Model Context Protocol) يحافظ على حالة kernel بايثون بشكل مستمر عبر الجلسات، مما يتيح تخزين المتغيرات والوظائف بين عمليات التشغيل المتعددة. يعمل كجسر بين مساعدي الذكاء الاصطناعي وبيئة Python، مما يسرع بشكل كبير المهام التي تتطلب معالجة بيانات متكررة أو تحميل نماذج ضخمة.
مساعد بريد إلكتروني يعمل بالذكاء الاصطناعي، يساعد في تنظيم صندوق الوصول وكتابة الردود وإدارة التقويم والملفات المرفقة، مع إمكانية الاستضافة الذاتية ودعم الدردشة عبر Slack أو Telegram
منصة تعاون في التصميم مدعومة بالذكاء الاصطناعي من تطوير Tencent، تتيح إنشاء وتحرير واجهات المستخدم (UI/UX) مباشرة عبر الأوامر النصية، مع إمكانية التحويل الفوري إلى كود برمجي ومشاركة العمل بشكل متزامن بين المصممين والمطورين.
منصة مفتوحة المصدر لتطوير تطبيقات LLM تجمع بين بناء سير العمل المرئي، وخطوط أنابيب RAG، وقدرات الوكلاء، وإدارة النماذج، ومراقبة الأداء في نظام واحد ذاتي الاستضافة.
وكيل برمجة بالذكاء الاصطناعي مفتوح المصدر، صُمم للمطورين، يتميز بالمرونة الكاملة في اختيار النماذج والاستضافة الذاتية والخصوصية، مع واجهات متعددة تشمل سطر الأوامر وسطح المكتب والإضافات.
منصة فيديو بالذكاء الاصطناعي مفتوحة المصدر وقابلة للاستضافة الذاتية، تجمع بين ثلاث أدوات قوية لإنشاء المحتوى القصير: مولد المقاطع، منتج فيديوهات UGC، واستوديو يوتيوب، كل ذلك دون علامات مائية أو حدود.
Magnific سابقا Freepik هي منصة إبداعية شاملة ومتكاملة تجمع بين أكثر من 200 مليون أصل رسومي ومكتبة ضخمة من الموارد، إلى جانب مجموعة متطورة من أدوات الذكاء الاصطناعي التوليدي لإنشاء الصور ومقاطع الفيديو والصوت وتحريرها، كل ذلك في مكان واحد.
شركة صينية رائدة في نماذج الذكاء الاصطناعي التوليدي، تقدم نماذج متعددة الوسائط للغة والفيديو والصوت، وتوفر منصة مفتوحة للمطورين، وتتميز بطرحها العام الأولي السريع والنمو القوي.
أول وكيل تصميم متعدد الوسائط في العالم (AI Design Agent)، يحول فكرة واحدة إلى مشروع إبداعي كامل يشمل الصور والفيديو والصوت والرسومات ثلاثية الأبعاد والهوية التجارية، في لوحة عمل واحدة.
منصة رائدة في إنشاء الصور بالذكاء الاصطناعي، تعمل عبر Discord، وتتميز بجودة صور فائقة الواقعية وأسلوب فني مميز، مع إصدار V8 الذي يقدم سرعة 5 أضعاف ودقة 2K أصلية.
منصة لإنشاء الفيديو بالذكاء الاصطناعي تقدم تحكماً دقيقاً في حركة الكاميرا والسيناريو، وأداة متخصصة لصنع فيديوهات الشخصيات الناطقة "Speak" مع أكثر من 80 قالب حركة.
أداة متقدمة لتوليد الفيديو بالذكاء الاصطناعي من MiniMax، تتميز بقدرتها على تنفيذ تعليمات معقدة وفيزياء متطرفة مثل الجمباز، وتقدم جودة 1080p أصلية بتكلفة اقتصادية قياسية.
مساعد برمجي مفتوح المصدر لتطوير تطبيقات الويب كاملة المكدس باستخدام نماذج لغوية متعددة، حيث يمكنك الاختيار من بين 19+ مزود ذكاء اصطناعي وتشغيله محليًا.
منصة ذكاء اصطناعي قابلة للتخصيص تعمل في وضع الاستضافة الذاتية مع دعم كامل للعمل دون اتصال بالإنترنت، وتوفر واجهة سهلة الاستخدام لمختلف نماذج اللغات الكبيرة.
حاسوب معرفي وبيئي متكامل يعمل دون اتصال بالإنترنت (Offline-first)، يضم أدوات الطوارئ، المعرفة، والذكاء الاصطناعي في نظام واحد قابل للنشر على الخوادم المنزلية.
منصة مفتوحة المصدر لبناء وكلاء وتطبيقات الذكاء الاصطناعي (LLM Apps) باستخدام واجهة سحب وإفلات، بدون الحاجة إلى برمجة، مع دعم للنشر على السحابة أو الخوادم الخاصة.
أداة برمجة تعمل بالذكاء الاصطناعي (AI Agent) مفتوحة المصدر، نشأت من إعادة هندسة نظيفة (Clean-room Rewrite) لأداة Claude Code بعد تسريب كودها، وتعتبر بديلاً قانونياً ومجتمعياً مثيراً للجدل.
خادم MCP (Model Context Protocol) يمنح مساعد الذكاء الاصطناعي (AI Agent) وصولاً كاملاً إلى ووردبريس – تشغيل كود PHP، الاستعلام عن قاعدة البيانات، واستدعاء واجهات برمجة التطبيقات (APIs) الخاصة بالإضافات.
أداة تحرير ترجمة فيديو مدعومة بالذكاء الاصطناعي، مع محرر مرئي، التعرف على الكلام (Whisper)، وتصدير بصيغ متعددة. مبنية على React وتعمل محلياً في المتصفح.
برومبتس دوت تشات (Prompts.chat) هو مجتمع مفتوح المصدر لمشاركة واكتشاف وجمع prompts (التعليمات النصية) للذكاء الاصطناعي التوليدي، مع إمكانية الاستضافة الذاتية للحفاظ على الخصوصية.
بيربلكسيكا (Perplexica) هو محرك إجابة (Answering Engine) مفتوح المصدر يعمل بالذكاء الاصطناعي ويركز على الخصوصية، يمكن تشغيله بالكامل على أجهزتك الخاصة مع دعم نماذج LLM محلية وسحابية.
نوفر ستوديو (Nover Studio) هو أول مجموعة أدوات ذكاء اصطناعي (AI Suite) متكاملة مصرية 100%، مصممة خصيصًا للمصممين والمبدعين للتحكم الكامل في الإنتاج المرئي الاحترافي.
مشروع مفتوح المصدر رائد لتوليد الكلام بالعربية (Text-to-Speech) يدعم 12 لهجة عربية مختلفة، بما في ذلك الفصحى والمصرية والخليجية والشامية، مع نماذج مدربة مسبقاً.
لوحة معلومات استخباراتية عالمية مفتوحة المصدر تعمل بالذكاء الاصطناعي، تجمع بين تحليل الأخبار والمراقبة الجيوسياسية وتتبع البنية التحتية في واجهة موحدة مع دعم 16 لغة.
واجهة رسومية متطورة ومفتوحة المصدر لعزل الصوت وفصل المصادر الصوتية باستخدام شبكات عصبية عميقة (Deep Neural Networks)، تتيح إزالة الصوت من الأغاني بجودة احترافية.
إطار عمل متقدم ومفتوح المصدر لرفع دقة الفيديو (Super Resolution) واستيفاء الإطارات (Frame Interpolation) باستخدام تقنيات التعلم الآلي، مع دعم لتحسين جودة مقاطع الفيديو القديمة والصور وملفات GIF.
منصة متطورة لتوليد الفيديو بالذكاء الاصطناعي من ByteDance، تحول النصوص والصور إلى مقاطع فيديو عالية الجودة مع صوت متزامن، وتتميز بحركات سلسة ودقة في تنفيذ التعليمات.