GPT
L

LLaDA2.2-flash

קוד פתוח

inclusionAIapache-2.02026-07-16

  • transformers
  • safetensors
  • llada2_moe
  • text-generation
  • dllm

זהו מודל דיפוזיה לשפה בארכיטקטורת תערובת מומחים עם 103 מיליארד פרמטרים. הוא מיועד לסוכנים ומשלב פעולות עריכה מובנות של מחיקה והוספה בתוך תהליך הדגימה המקבילי.

  • 103Bפרמטרים
  • 131,072טוקנים בהקשר
  • 192 GBמשקל הקבצים
  • 1,708הורדות בחודש

מה זה

המודל שובר את השגרה של מודלים אוטורגרסיביים רגילים. במקום לחזות טוקן אחרי טוקן, הוא מבוסס על מודל דיפוזיה לשפה עם חלון הקשר של 131,072 טוקנים ומנגנון ניתוב מומחים ברמת בלוק דיפוזיה. הייחוד האמיתי שלו טמון בשילוב טוקני שליטה של מחיקה והכנסה, שמאפשרים לו לערוך, להוריד קטעים מיותרים ולתקן שגיאות תוך כדי יצירה מקבילית במשימות מרובות שלבים.

בבדיקות המפתחים, היתרון המובהק הוא המהירות. הוא מגיע לקצב שנע בין 459 ל־703 טוקנים בשנייה, כמעט כפול מהמתחרה שנבדק מולו. עם זאת, מבחינת איכות התוצאה עצמה המצב מעורב. במבחני סוכנים טהורים כמו טאו בריבוע וממשקי כלים הוא מציג יתרון קל, אבל במשימות קוד מורכבות הוא מפגר מאחור, עם 49.28 אחוזים בבדיקת התוכנה מול 61.20 של המתחרה.

מתאים ל

  • סוכני שיחה מרובי שלבים

    יכולת עריכה מובנית ותיקון שגיאות בזמן אמת הופכות אותו למתאים לתהליכי שיחה וקריאה לכלים.

  • עבודה עם הקשר ארוך

    חלון של 128 אלף טוקנים בשילוב קצב יצירה מהיר במיוחד מאפשר מעבר על מסמכים ונתונים גדולים.

  • מערכות הפעלת כלים

    המודל הציג ביצועים גבוהים במבחני אטלס וטאו לבדיקת חיבור לכלים חיצוניים.

איפה זה נופל

החולשה העיקרית של המודל נראית במשימות הנדסת תוכנה. הוא השיג 49.28 בלבד בבדיקות וריפייד ו־25 בלבד במבחן הרב לשוני, שזה פער מורגש מול מודלים מתחרים. בנוסף, המפתחים מודים בעצמם שהורדת ספי הניקוי מרעש אמנם מאיצה את הריצה, אבל עלולה להוביל לפלט לא יציב ולחזרתיות מיותרת. נקודה קריטית נוספת היא שאין נתונים על תמיכה ישירה בשפה העברית.

שאלות
נפוצות

האם המודל מוכן להרצה פשוטה במוצר קיים?

עדיין לא לחלוטין. למרות שהוא תומך בטרנספורמרס, תשתית הפריסה המומלצת עבורו בשרתי אס ג'י לאנג עדיין מסומנת ככזו שתגיע בקרוב, ופריסה עצמאית דורשת תמיכה ייעודית במודלי דיפוזיה.

מה היתרון של מודל דיפוזיה מול מודל שפה רגיל כאן?

הוא מייצר טוקנים במקביל ולא אחד אחרי השני, מה שמניב קצב מהיר של מאות טוקנים בשנייה, ומאפשר לו למחוק או להכניס מידע בקטעים שכבר נוצרו.

האם המודל יתאים לתיקון באגים וכתיבת קוד?

פחות מומלץ למטרה זו בלבד. בבדיקות המפתחים עצמם על בנצ'מרק של מהנדסי תוכנה הוא הציג ציונים נמוכים משמעותית ביחס למודל הבדיקה המקביל.

איך מריצים

כדי להריץ מודל במשקל 192 גיגה בייט בפורמט בי פלוט 16 עם 103 מיליארד פרמטרים, צריך חומרה ייעודית כבדה מאוד. מדובר בכמה כרטיסי שרת עם זיכרון וידאו מצטבר של לפחות 200 גיגה בייט רק למשקלים עצמם, עוד לפני חישוב הזיכרון הנדרש להקשר מלא של 128 אלף טוקנים.

המפתחים ממליצים להשתמש בשרת אס ג'י לאנג, אך מציינים בעמוד שהתמיכה בו עדיין נמצאת בשלבי פיתוח. אם אין לכם אשכול שרתים מקומי שמסוגל להתמודד עם ארכיטקטורת מומחים ודיפוזיה במקביל, כדאי לחכות לממשקי שירות מנוהלים או לעדכוני תשתית יציבים יותר לפני שמנסים להרים את זה לבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/LLaDA2.2-flash")
print(pipe("שלום"))

הקבצים

45 קבצים במאגר, 192 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים. התנאי העיקרי הוא שמירת הודעות זכויות היוצרים והרישיון המקורי, בלי חובת פתיחה של הקוד הפרטי שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗