GPT
L

LLaDA2.0-mini

קוד פתוח

inclusionAIapache-2.02025-11-25

  • transformers
  • safetensors
  • llada2_moe
  • text-generation
  • dllm

מודל דיפוזיה לשפה בארכיטקטורת מומחים, שמפעיל רק 1.4 מיליארד פרמטרים מתוך 16 מיליארד בזמן ריצה. הוא נועד למי שרוצה ביצועים חזקים בקוד ומתמטיקה בעלות חישוב נמוכה.

  • 16Bפרמטרים
  • 32,768טוקנים בהקשר
  • 30.3 GBמשקל הקבצים
  • 233,554הורדות בחודש

מה זה

הארכיטקטורה כאן שונה מרוב מה שמסתובב בשוק. במקום מודל שפה רגיל שפולט מילה אחרי מילה, מדובר במודל דיפוזיה שמתבסס על ארכיטקטורת מומחים. יש לו 16 מיליארד פרמטרים בסך הכל, אבל בכל שלב חישוב פעילים רק 1.4 מיליארד, מה שחוסך משאבים בלי לוותר על איכות הידע שנצבר באימון על 20 טריליון טוקנים.

במבחני ביצועים הוא עומד יפה מאוד מול מתחרים דחוסים בגודל 8B ואפילו עוקף אותם בחלק מהמשימות. הוא מציג תוצאות טובות בקוד עם 86.59 במבחן HumanEval וציון של 93.22 במתמטיקה במבחן MATH, לצד ביצועים סבירים של 70.90 בהפעלת כלים לפי מדד BFCL_Live.

מתאים ל

  • פתרון בעיות מתמטיות

    משיג תוצאה של 93.22 במבחן MATH ומתאים לחישובים מורכבים.

  • יצירת קוד פייתון

    עם ציון של 86.59 ב־HumanEval הוא מספק בסיס חזק להשלמת קוד.

  • הפעלת כלים וסוכנים

    תומך ב־Tool Calling ומציג 70.90 במדד BFCL_Live למשימות אוטונומיות.

איפה זה נופל

המודל רגיש מאוד להגדרות הריצה. היוצרים מדגישים שחייבים להריץ אותו עם טמפרטורה 0.0, כי כל ערך גבוה יותר גורם לערבוב שפות ולנפילה ברמת הביצועים. בנוסף, משימות מורכבות במיוחד חושפות חולשה, ובמבחן BigCodeBench-Full הוא קיבל 32.89 בלבד. היכולת שלו לעקוב אחרי הוראות קפדניות ב־IFEval עומדת על 80.78, נמוך יותר מחלק מהמתחרים, מה שמחייב בדיקה של הפרומפטים לפני שמשלבים אותו בסביבה חיה.

אותה משפחה

LLaDA2.0-mini יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד רגיל?

לא ממש. הקבצים שוקלים מעל 30 גיגה בייט ודורשים כרטיס מסך חזק כדי לשמור את כל הפרמטרים בזיכרון. למרות שרק חלק קטן מהם פעיל בכל רגע נתון, תצטרכו חומרה ייעודית של תחנת עבודה או שרת.

איך משפיעה שיטת הדיפוזיה על יצירת הטקסט?

המודל לא מייצר טוקן בודד בכל פעם כמו מודל שפה רגיל, אלא עובד בבלוקים של צעדים. היוצרים ממליצים להגדיר אורך בלוק של 32 עם 32 צעדים וטמפרטורה אפס כדי לקבל פלט עקבי.

איך מריצים

המשקלים תופסים 30.3 גיגה בייטים בזיכרון האחסון, מה שאומר שתצטרכו כרטיס מסך מקצועי עם לפחות 32 גיגה זיכרון כדי לטעון אותו, או לחלופין לפצל אותו על כמה כרטיסים ביתיים דרך ספריית transformers. למרות שרק חלק קטן מהפרמטרים רץ בפועל, כל המודל חייב לשבת בזיכרון.

אם אתם לא רוצים להחזיק שרת כזה פעיל, שווה לבדוק אם יש שירותי ענן שמריצים אותו ישירות. מי שמעדיף משהו שונה מעט יכול לבדוק גם את גרסת ה־flash מאותה משפחה, שנועדה ליישומים מהירים יותר.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/LLaDA2.0-mini")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 מלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לצרף אותו למוצרים סגורים ולהפיץ אותו בחופשיות, כל עוד משאירים את הצהרת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗