AirLLM

تشغيل نماذج لغة ضخمة بحجم 70B على GPU بـ 4GB فقط — بدون كمّة أو تشذيب. يدعم Llama 3.1 405B و DeepSeek-V3 671B و Kimi K3 2.8T.


نبذة مفصلة عن AirLLM

AirLLM هي مكتبة بايثون تقلل استهلاك ذاكرة GPU بشكل جذري أثناء الاستدلال، مما يتيح تشغيل نماذج لغة ضخمة بحجم 70 مليار معلمة على بطاقة GPU واحدة بسعة 4GB فقط — بدون أي كمّة أو تشذيب أو تقطير. يعمل النظام بتحميل طبقة واحدة فقط من النموذج في VRAM في كل لحظة، لذا تعتمد الذاكرة المطلوبة على حجم الطبقة وليس حجم النموذج الكلي.

المميزات الرئيسية

  • بث الطبقات: تحميل طبقة واحدة فقط في VRAM في كل لحظة أثناء الاستدلال
  • بث الخبراء: لنماذج MoE المتناثرة — يحمّل فقط الخبراء الذين يحتاجها الرمز
  • AutoModel: كشف تلقائي لنوع النموذج من معرّف Hugging Face
  • ضغط النموذج: كمّة كتلية 4-bit/8-bit لتسريع الاستدلال 3 مرات مع فقد دقة ضئيل
  • دعم FP8: ابتداءً من الإصدار 3.0
  • استباق التحميل: تداخل تحميل النموذج والحساب لتحسين الأداء 10%
  • نطاق واسع من النماذج: Llama 2/3/3.1/4، Qwen 1/2/3، DeepSeek V2/V3/R1، Mistral، Mixtral، Phi، Gemma، ChatGLM، Baichuan، InternLM، Yi، Kimi K3

يدعم Linux و macOS (Apple Silicon) وCPU. مرخّص تحت Apache 2.0 بأكثر من 27,000 نجمة على GitHub.

تعلم أكثر عن AirLLM

مختارات لبرنامج AirLLM

أسئلة شائعة عن AirLLM

فيديوهات

بدائل مشابهة

عروض وخصومات


أخر تحديث للصفحة 4 August، 2026