GPT
L

LLaDA2.1-mini

קוד פתוח

inclusionAIapache-2.02026-02-09

  • transformers
  • safetensors
  • llada2_moe
  • text-generation
  • dllm

מודל שפה מבוסס דיפוזיה וארכיטקטורת תערובת מומחים עם 16 מיליארד פרמטרים. הוא מיועד למי שמחפש הסקת מסקנות מהירה במיוחד ויכולת תיקון שגיאות מקבילית.

  • 16Bפרמטרים
  • 32,768טוקנים בהקשר
  • 30.3 GBמשקל הקבצים
  • 109,592הורדות בחודש

מה זה

במקום לחזות מילה אחרי מילה כמו מודל רגרסיבי רגיל, המודל הזה עובד בשיטת דיפוזיה ומייצר טקסט באמצעות ניקוי רעשים ותיקון שגיאות תוך כדי ריצה. הוא כולל 20 שכבות, אוצר מילים של 157,184 טוקנים, ותומך בהקשר של 32,768 טוקנים. הרעיון המרכזי כאן הוא שילוב של ארכיטקטורת MoE עם מנגנון עריכה שמאפשר לבחור בין ריצה מהירה מאוד לבין ריצה מדויקת.

במדדים, המודל מציג פער ברור בין שני מצבי העבודה שלו. במצב איכות הוא מגיע לציון ממוצע של 63.90, עם תוצאות תחרותיות במתמטיקה כמו 43.33 ב־AIME 2025 ו־82.93 ב־HumanEval+ לקוד. במצב מהירות הציון הממוצע יורד ל־62.07, אבל קצב ייצור הטוקנים לכל צעד זינוק עולה משמעותית, למשל קפיצה מ־3.63 ל־6.42 במבחן LiveCodeBench, על חשבון ירידה קלה בדיוק.

מתאים ל

  • ייצור קוד פייתון מהיר

    מגיע לציון 82.93 ב־HumanEval+ ומסוגל להוציא בלוקים שלמים במהירות גבוהה.

  • פתרון בעיות היגיון

    מקבל 77.10 ב־ZebraLogic במצב איכות, מתאים למשימות ניתוח שמרוויחות ממנגנון תיקון שגיאות.

  • מחקר על מודלי דיפוזיה

    מספק יישום נדיר ופתוח של מודל שפה מבוסס דיפוזיה בארכיטקטורת MoE.

איפה זה נופל

החיסרון הבולט מופיע במצב המהיר. הכרטיס מזהיר במפורש שהורדת סף הסינון כדי להשיג מהירות גורמת לגמגום וחזרתיות בטקסט. בנוסף, יכולות הקוד שלו במשימות מורכבות חלשות למדי, עם 28.85 בלבד ב־LiveCodeBench במצב מהיר ו־30.40 במצב איכות. גם בתחום ה־Nexus FC הוא משיג רק 31.59 עד 33.69, מה שמראה ששימוש בכלים וקריאות לפונקציות עדיין מוגבל מאוד ולא בשל להפקה מלאה.

שאלות
נפוצות

מה ההבדל בין מצב Speed למצב Quality?

ההבדל נקבע לפי ספי הדנויזינג בהגדרות הריצה. במצב Speed המודל מייצר יותר טוקנים בכל צעד ומסיים מהר יותר, אך עשוי לסבול מגמגום וירידה בדיוק, בעוד שבמצב Quality הוא משקיע יותר צעדים בעריכה ותיקון.

האם המודל תומך בעבודה חלקה עם סוכנים וכלים?

לא מומלץ להסתמך עליו למשימות סוכנים מורכבות כרגע. תוצאות המדידה שלו ב־Nexus FC נמוכות, והמפתחים עצמם ציינו ששילוב יכולות שימוש בכלים למרחקים ארוכים יגיע רק בעדכון הבא.

איך מריצים

המשקל הכולל של הקבצים עומד על 30.3 גיגה-בייט, מה שאומר שתצטרכו כרטיס מסך בודד עם 40 עד 48 גיגה-בייט זיכרון כדי להריץ אותו בנוחות בלי קוונטיזציה, או להשתמש ב־SGLang עם הגדרות ייעודיות לדיפוזיה כמו JointThreshold ו־flashinfer.

אם אין לכם חומרה ייעודית בענן, היוצרים מציעים להשתמש ב־API של LLaDA2.1-flash דרך שירות ZenmuxAI במקום להסתבך עם התקנה עצמית. המודל דורש דגלי ריצה מיוחדים כמו trust-remote-code והגדרת ספי ניקוי רעשים כדי לעבוד תקין.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/LLaDA2.1-mini")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗