GPT
L

LLaDA-8B-Base

קוד פתוח

GSAI-MLmit2025-02-19

  • transformers
  • safetensors
  • llada
  • text-generation
  • conversational

מודל שפה בגודל שמונה מיליארד פרמטרים שמבוסס על דיפיוז'ן במקום הארכיטקטורה הרגילה. הוא אומן מאפס כדי להתחרות ישירות בביצועים של לאמה 3.

  • 8Bפרמטרים
  • 14.9 GBמשקל הקבצים
  • 21,733הורדות בחודש
  • 102לייקים

מה זה

הצוות של GSAI-ML בנה כאן מודל דיפיוז'ן שמיועד לייצור טקסט, ולא עוד וריאציה על מודלים אוטורגרסיביים סטנדרטיים. לפי המפתחים, מדובר במודל ראשון מסוגו בסדר גודל כזה, והוא הגיע לרמת ביצועים שמתחרה בלאמה 3 בעלת שמונה מיליארד הפרמטרים.

השוני המרכזי נמצא במבנה הפנימי שנקרא LLaDAModelLM, שמתרחק מהאופן שבו רוב מודלי השפה פולטים מילים בזו אחר זו. אם אתם מחפשים לחקור כיוונים חדשים בעיבוד שפה שלא נשענים על הזרם המרכזי הרגיל, זו נקודת פתיחה טכנית שונה לגמרי מכל מה שמסתובב כרגע ברשת.

מתאים ל

  • מחקר על דיפיוז'ן בטקסט

    בדיקת אלטרנטיבות לארכיטקטורות המוכרות של מודלי שפה על גבי מודל גדול שכבר אומן מאפס.

  • אימון מודלים מותאמים

    נקודת פתיחה לכוונון עדין על משימות ספציפיות בעזרת בסיס תחרותי שמקביל ללאמה 3.

  • ניסויי ייצור טקסט

    בחינת יכולות כתיבה והשלמת משפטים במבנה שמסתמך על תמיכה חדשה במסכות קשב.

איפה זה נופל

מדובר במודל בסיס ולא במודל שעבר התאמה לשיחה, כך שהוא לא יענה לכם כמו צ'אטבוט מהקופסה בלי אימון נוסף או הנחיות מדויקות. מעבר לזה, ארכיטקטורת דיפיוז'ן לטקסט היא עדיין גישה לא שגרתית, וכרטיס המודל לא מפרט נתונים לגבי תמיכה בשפות שאינן אנגלית, מהירויות דגימה, או התנהגות מול עברית. תצטרכו לבדוק בעצמכם איך הוא מתמודד עם יצירת טקסט בפועל לפני שתסמכו עליו במערכת אמיתית.

אותה משפחה

LLaDA יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מוכן לשימוש ישיר כצ'אט?

לא, זו גרסת בסיס ולא גרסת שיחה שעברה התאמה לפקודות. כדי לקבל מענה לשאלות או לנהל איתו דיאלוג, תצטרכו לאמן אותו קודם על דאטה מתאים או להוסיף שכבת הנחיות קפדנית.

האם הוא נתמך בספריות פייתון סטנדרטיות?

הוא עובד עם ספריית transformers המוכרת ומשתמש בקוד ייעודי שהמפתחים פרסמו. יחד עם זאת, בגלל הארכיטקטורה השונה, שילוב בכלים אוטומטיים קיימים עשוי לדרוש התאמות קוד קלות מצידכם.

איך מריצים

כדי להריץ אותו מקומית דרך ספריית transformers תצטרכו כרטיס מסך עם לפחות שישה עשר עד עשרים וארבעה גיגה זיכרון וידאו, בהתחשב במשקל הקבצים שמגיע לכמעט חמישה עשר גיגה. המפתחים עדכנו לאחרונה את קובץ המידול כדי לתמוך במסכת קשב, מה שמקל מעט על השילוב בקוד קיים.

אם אין לכם שרת ייעודי או חומרה מתאימה, הקמה עצמית של מודל כזה תהיה יקרה וכבדה מדי רק בשביל ניסוי ראשוני. במצב כזה עדיף לחפש פתרונות ענן לפי שעה או שירותי הרצה מנוהלים במקום להשקיע בברזלים.

from transformers import pipeline

pipe = pipeline("text-generation", model="GSAI-ML/LLaDA-8B-Base")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון MIT, שזה הרישיון הכי פתוח ונוח שיש. מותר לכם להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצרים סגורים ולהפיץ אותו הלאה, כל עוד אתם שומרים על הקרדיט והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗