GPT
L

LLaDA2.0-flash

קוד פתוח

inclusionAIapache-2.02025-11-25

  • transformers
  • safetensors
  • llada2_moe
  • text-generation
  • dllm

מודל שפה מבוסס דיפיוז'ן בארכיטקטורת מומחים עם 103 מיליארד פרמטרים. מתאים למי שרוצה ביצועי קוד והיגיון חזקים עם עלות חישוב של 6.1 מיליארד פרמטרים פעילים בלבד בזמן ריצה.

  • 103Bפרמטרים
  • 32,768טוקנים בהקשר
  • 192 GBמשקל הקבצים
  • 2,628הורדות בחודש

מה זה

מדובר במודל שפה מסוג דיפיוז'ן ולא מודל אוטורגרסיבי רגיל, שעבר אימון הוראות ומבוסס על ארכיטקטורת Mixture of Experts. הוא אומן על בסיס סדרת Ling2.0 עם כ־20 טריליון טוקנים. מתוך 103 מיליארד הפרמטרים שלו, בזמן הסקה מופעלים רק 6.1 מיליארד פרמטרים, מה שחוסך משאבי חישוב לעומת מודלים צפופים בגודל דומה.

במבחני הביצועים הוא מציג ציונים חזקים מאוד בקוד ובמתמטיקה, למשל 94.51 ב־HumanEval ו־96.06 ב־GSM8K, לצד 75.43 במבחן BFCL_Live שבודק הפעלת כלים וסוכנים. התוצאות האלה מציבות אותו בקו אחד מול מודלים מובילים בקטגוריה שלו, במיוחד במשימות תכנות ופתרון בעיות מורכבות.

מתאים ל

  • מחולל ובודק קוד

    משיג 94.51 ב־HumanEval ומתאים לייצור פונקציות ובדיקות תוכנה מדויקות.

  • סוכן להפעלת כלים

    תומך בקריאות לכלים חיצוניים ומגיע לציון 75.43 במבחן הסוכנים BFCL_Live.

  • פתרון בעיות מתמטיות

    רושם 96.06 ב־GSM8K ו־95.44 ב־MATH, לכן מתאים לעיבוד חישובים והוכחות.

איפה זה נופל

היוצרים מזהירים מפורשות שהעלאת הטמפרטורה מעל 0.0 עלולה לגרום לערבוב שפות ביציאה ולירידה בביצועים, מה שמגביל מאוד משימות שדורשות יצירתיות או גיוון בטקסט. בנוסף, מדובר בארכיטקטורת דיפיוז'ן שמחייבת 32 צעדי דגימה לכל ריצה, וחלון ההקשר מוגבל ל־32,768 טוקנים, כך שהוא לא יתאים למסמכי ענק.

אותה משפחה

LLaDA2.0-flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים ליצירת טקסט חופשי ויצירתי?

לא ממש. היוצרים ממליצים להריץ אותו בטמפרטורה 0.0 בלבד כדי למנוע ערבוב שפות ופגיעה באיכות, מה שהופך את הפלט לדטרמיניסטי מאוד ולא מתאים לכתיבה יצירתית.

כמה זיכרון דרוש כדי לטעון אותו?

קבצי המודל שוקלים 192 גיגה בייט בסך הכול. למרות שבזמן חישוב מופעלים רק 6.1 מיליארד פרמטרים, כל 103 מיליארד הפרמטרים חייבים לשבת בזיכרון המערכת לצורך הריצה.

איך מריצים

כדי להריץ אותו צריך להתמודד קודם כל עם משקל הקבצים, שעומד על 192 גיגה בייט בפורמט bfloat16 ומחולק ל־51 קבצים. נדרשת תשתית שרתים רצינית עם זיכרון וידאו גדול מאוד שמסוגל לטעון את כל המשקל הזה לזיכרון, גם אם בפועל רצים רק 6.1 מיליארד פרמטרים בכל צעד.

היוצרים ממליצים להגדיר בקרת דגימה עם טמפרטורה 0.0, ערך block length של 32 ומספר צעדים של 32. מי שאין לו שרת ייעודי עם מספיק זיכרון וידאו יעדיף להמתין לממשקי ענן או להשתמש בגרסת ה־mini הקטנה יותר של אותה סדרה.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/LLaDA2.0-flash")
print(pipe("שלום"))

הקבצים

51 קבצים במאגר, 192 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי של הקוד והמשקלים, והפצה בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗