GPT
L

LLaDA-MoE-7B-A1B-Instruct

קוד פתוח

inclusionAIapache-2.02025-09-10

  • transformers
  • safetensors
  • llada
  • dllm
  • diffusion

מודל שפה שמבוסס על דיפוזיה ומשלב ארכיטקטורת מומחים חסכונית. הוא מפעיל רק 1.4 מיליארד פרמטרים בכל שלב ומיועד למשימות קוד והיגיון מורכב.

  • 7.4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 13.7 GBמשקל הקבצים
  • 1,130הורדות בחודש

מה זה

מדובר במודל שפה מבוסס דיפוזיה, להבדיל ממודלים אוטורגרסיביים רגילים שפולטים מילה אחרי מילה. הוא אומן מאפס על כעשרים טריליון טוקנים, וכולל ארכיטקטורת מומחים שמאפשרת להחזיק מעל שבעה מיליארד פרמטרים בקובץ אבל להפעיל רק חלק קטן מהם בזמן חישוב בפועל.

הוא מיועד לעבודה מעשית עם הנחיות וכולל יכולות של הפעלת כלים, כתיבת קוד ופתרון בעיות מתמטיות. בניגוד למודלים צפופים באותו סדר גודל, השילוב של מומחים עם דיפוזיה מנסה לתת מענה זול יותר חישובית בלי לוותר על עומק ההבנה של מודל גדול יותר.

מתאים ל

  • הפעלת סוכנים וכלים

    הוא אומן לתמוך בקריאות לפונקציות ומתאים למערכות שדורשות שילוב כלים חיצוניים.

  • יצירת קוד בסביבה מקומית

    מפעיל רק 1.4 מיליארד פרמטרים בזמן ריצה ומספק ביצועים גבוהים במשימות תכנות.

  • פתרון בעיות מתמטיות

    האימון שלו התמקד במשימות היגיון מורכבות שמצריכות חישוב מדויק בחומרה מוגבלת.

איפה זה נופל

יש פער לא ברור בנתונים שהיוצרים מפרסמים לגבי חלון ההקשר, כשמקום אחד מדווח על 8,192 טוקנים והמפרט עצמו נוקב ב־4,096 בלבד. מעבר לזה, מודלי דיפוזיה לשפה דורשים ספריות ייעודיות כמו dInfer כדי לא לזחול, ובסביבת transformers רגילה המהירות צונחת בלי האופטימיזציות האלה. אין בכרטיס שום מידע על תמיכה בשפות אחרות כמו עברית.

שאלות
נפוצות

למה צריך ספריה מיוחדת כדי להריץ אותו?

מכיוון שהוא מודל דיפוזיה ולא מודל שפה רגיל, הרצה בספריית transformers סטנדרטית תהיה אטית מאוד. היוצרים בנו כלי ייעודי בשם dInfer שמאחד את המומחים ומאיץ את קצב הפליטה.

מה ההבדל בינו לבין גרסת ה־TD?

גרסת ה־TD עברה תהליך נוסף שמאפשר לה לפלוט כמה טוקנים בכל מעבר חישובי, מה שמקצר משמעותית את זמן התגובה בריצה.

איך מריצים

כדי להריץ אותו צריך זיכרון שיחזיק 13.7 גיגה בייט של משקלים, כלומר כרטיס מסך בודד עם 16 או 24 גיגה בייט של זיכרון יעשה את העבודה בפורמט הרגיל. המפתחים ממליצים להמיר את המשקלים למבנה מאוחד ולהריץ דרך ספריית dInfer שלהם לקבלת קצב יצירה גבוה, במקום שימוש ישיר ואיטי בספריית transformers.

אם אתם רוצים מהירות גבוהה במיוחד בלי להסתבך עם המרות, יש להם גרסה בשם Instruct-TD שמשתמשת בזיקוק מסלולים כדי לחלץ כמה טוקנים בריצה אחת. למי שאין כרטיס מתאים מקומית, עדיף להמתין לשירותי ענן שיריצו את התשתית הייעודית הזו.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/LLaDA-MoE-7B-A1B-Instruct")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים זמינים תחת רישיון אפאצ'י 2.0. מותר להשתמש בהם לצרכים מסחריים, לשנות את הקוד ולהטמיע בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗