GPT
L

LLaDA2.0-Uni

קוד פתוח

inclusionAIapache-2.02026-04-22

  • transformers
  • diffusers
  • safetensors
  • llada2_moe
  • feature-extraction

ארכיטקטורת דיפוזיה מבוססת מומחים שמשלבת הבנת תמונה, יצירה ועריכה ברשת אחת. מתאים למי שרוצה צינור מולטימדיה שלם בלי לשרשר מודל שפה נפרד למודל תמונה.

  • 16Bפרמטרים
  • 8,192טוקנים בהקשר
  • 56.1 GBמשקל הקבצים
  • 4,580הורדות בחודש

מה זה

הפיתוח הזה מאחד משימות טקסט ותמונה למודל יחיד בעזרת מנגנון חיזוי מסיכה של מודלי דיפוזיה. במקום לצרף מודל שפה נפרד למנוע תמונות כמו סטייבל דיפיוז'ן, השלד כאן הוא תערובת מומחים של 16 מיליארד פרמטרים שמפעילה כמיליארד פרמטרים בלבד בכל טוקן בזמן ריצה. המערכת קוראת תמונות באמצעות טוקנייזר סמנטי בדיד של סיגליפ, ומייצרת פלטים ויזואליים דרך מפענח דיפוזיה ייעודי שעבר זיקוק לשמונה צעדים.

המודל תומך ביצירת תמונות מטקסט, כולל מצב חשיבה מוקדם, הבנת מסמכים ושאלות ותשובות על תמונות, עריכת תמונות לפי הנחיות וטקסט ותמונה שזורים. מנגנון האצה בשם ספרינט משלב שימוש חוזר במטמון והסרת מסיכות דינמית לפי רמת הביטחון של המודל כדי לקצר את זמני הריצה.

מתאים ל

  • עריכת תמונות מהירה בפקודות

    מפענח שמונה הצעדים מאפשר לשנות תמונות לפי הוראות טקסט ישירות במודל אחד.

  • ניתוח מסמכים באנגלית

    טוקנייזר סיגליפ הסמנטי מאפשר מענה על שאלות ופירוק תוכן חזותי מטפסים ותרשימים.

  • יצירת תמונות עם נימוק מקדים

    תמיכה מובנית בשלב חשיבה לפני יצירת התמונה לשיפור הדיוק בהנחיות מורכבות.

איפה זה נופל

התמיכה שלו בטקסט ובתמונות שזורים היא ראשונית בלבד לפי היצרן, כך שלא כדאי לבנות עליה לתהליכים מורכבים. מנגנון ההאצה ספרינט נופל לחלוטין וחוזר למהירות הבסיס האיטית ברגע שמשתמשים בעריכת תמונה עם שתי הנחיות שונות, כי הוא לא תומך בסכמת ההנחיה המשולשת הזו. המודל מוגבל לשפה האנגלית בלבד, וחלון ההקשר עומד על 8,192 טוקנים, מה שמגביל ניתוח של מסמכים מרובי עמודים ברצף.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי רגיל?

לא. המודל דורש כ־35 גיגה בייט של זיכרון גרפי להבנה וכ־47 גיגה בייט ליצירת תמונה. כרטיסים ביתיים נפוצים מגיעים ל־24 גיגה בייט לכל היותר, כך שתצטרכו חומרה ארגונית או שימוש בגרסת ה־FP8 אם יתאפשר לכווץ אותה לשני כרטיסים.

האם המודל מבין ומייצר טקסט בעברית?

לא לפי התיעוד. המודל הוגדר ונבדק לשפה האנגלית בלבד, ואין לו תמיכה מוצהרת בעברית, כך שלא מומלץ להסתמך עליו למשימות שדורשות פלט או קלט בעברית.

איך המודל מייצר תמונות במהירות אם הוא מבוסס דיפוזיה?

הוא כולל מפענח מזוקק בשם טורבו שמייצר תמונה בשמונה צעדי דיפוזיה במקום חמישים. בנוסף, מנגנון ספרינט מדלג על חישובים חוזרים ומנחש מראש טוקנים בעלי סבירות גבוהה.

איך מריצים

כדי להריץ אותו צריך כרטיס מקצועי כבד. להבנת תמונה בלבד נדרשים כ־35 גיגה בייט זיכרון וידאו, וליצירה או עריכה תצטרכו כ־47 גיגה בייט בגלל מפענח הדיפוזיה שדורש עוד 12 גיגה בייט. כרטיס ביתי יחיד לא יספיק פה, ותצטרכו לפחות כרטיס A100 או H100 בנפח 80 גיגה בייט, או פיצול בין כרטיסים. המשקל הכולל להורדה עומד על 56.1 גיגה בייט בגרסת ברירת המחדל.

קיימת גרסת שמונה ביט בשם FP8 שחוסכת מקום בזיכרון, אבל היא עדיין דורשת סביבת קידוד תומכת פלאש אטנשן 2 ופייתורץ' עם קודה 12.4. תמיכה במנועי הגשה כמו אס ג'י לאנג עדיין בפיתוח, כך שכרגע ההרצה היא דרך הקוד המקורי. אם אין לכם גישה לשרת ייעודי מתאים, עדיף להמתין לחלופת ענן או שירות חיצוני מנוהל.

from transformers import pipeline

pipe = pipeline("any-to-any", model="inclusionAI/LLaDA2.0-Uni")
print(pipe("שלום"))

הרישיון

רישיון אפאצ'י 2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המודל בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית בקבצים שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗