GPT
M

MMaDA-8B-Base

קוד פתוח

Gen-Versemit2025-05-19

  • transformers
  • safetensors
  • llada
  • feature-extraction
  • any-to-any

מודל מולטימודלי מבוסס דיפיוז'ן שמחבר הבנת טקסט, הסקת מסקנות ויצירת תמונות באותה ארכיטקטורה. הוא מעניין בעיקר למי שחוקר חלופות למודלים האוטורגרסיביים הרגילים.

  • 8.1Bפרמטרים
  • 15.1 GBמשקל הקבצים
  • 1,275הורדות בחודש
  • 91לייקים

מה זה

מדובר במודל בסיס שמשתמש בארכיטקטורת דיפיוז'ן אחידה במקום במודל שפה אוטורגרסיבי רגיל. הוא עושה משימות any-to-any, כלומר מקבל טקסט ומייצר טקסט או תמונות בלי רכיבים ייעודיים שנפרדים לכל סוג מדיה. הגישה הזו נשענת על ניסוח הסתברותי משותף שמטפל במידע בלי תלות בסוג המודליות.

מעבר למבנה הדיפיוז'ן, המפתחים שילבו כאן אימון שרשרת מחשבה ארוכה שמשותפת לטקסט ולתמונה, יחד עם אלגוריתם בשם UniGRPO שמבצע אופטימיזציה מבוססת גרדיאנט מדיניות ומודלי תגמול מגוונים. אין בכרטיס טבלאות ביצועים או ציונים מספריים, כך שקשה לדעת מה איכות הפלט בפועל מול מודלים מוכרים בגודל שמונה מיליארד פרמטרים.

מתאים ל

  • מחקר ארכיטקטורות דיפיוז'ן

    הוא מספק בסיס קוד פתוח למי שרוצה לבדוק חלופות למודלי שפה אוטורגרסיביים ביצירת טקסט ותמונה.

  • יצירת תמונות מהסברים

    הארכיטקטורה תומכת בשרשרת מחשבה מעורבת שמכוונת ישירות להפקת תמונה מתוך תהליך הסקה טקסטואלי.

  • ניסויי RL עם UniGRPO

    הוא מתאים לבדיקת שיטות כוונון מתקדמות מבוססות תגמול שפותחו במיוחד עבור מודלי בסיס מסוג דיפיוז'ן.

איפה זה נופל

זהו מודל בסיס, מה שאומר שהוא לא עבר התאמה לשיחה מול משתמש קצה. הכרטיס לא מציג נתוני בדיקות, ציוני בנצ'מרק או השוואות ישירות למודלים אחרים. בנוסף, מודלי דיפיוז'ן להפקת טקסט מתנהגים אחרת לגמרי ממודלים רגילים, כך שזמני התגובה ואופי הפלט עשויים להיות שונים מאוד ממה שאתם מכירים, וחובה לבדוק התנהגות כזו ידנית.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כצ'אטבוט?

לא, זהו מודל בסיס שלא עבר כוונון לשיחות. תצטרכו לאמן אותו בעצמכם על נתוני שיחה או להשתמש בו לתשתיות מחקר ופיתוח בלבד.

האם הוא תומך בעברית?

החומרים שפורסמו מתארים משימות באנגלית ולא מציינים תמיכה בשפות נוספות. סביר להניח שיכולת ההבנה וההפקה בעברית מוגבלת מאוד, ותצטרכו לבדוק את זה ידנית בדמו.

איך מריצים

כדי להריץ אותו צריך לטעון משקלי bfloat16 שתופסים קצת יותר מ־15 גיגהבייט זיכרון בכרטיס המסך, עוד לפני שמחשבים את זיכרון העבודה שדרוש להסקה בפועל. מריצים אותו ישירות דרך ספריית transformers עם הקוד שהמפתחים פרסמו בגיטהאב.

אם אין לכם כרטיס מסך עם מספיק זיכרון להחזיק את כל המשקלים האלה בבת אחת, ההרצה המקומית תיכשל מיד. במצב כזה, עדיף לבדוק קודם את הדמו הציבורי שהם העלו בספייס של Hugging Face כדי לראות אם הארכיטקטורה בכלל עונה על הצרכים שלכם לפני שמשקיעים בהקמת שרת ייעודי.

from transformers import pipeline

pipe = pipeline("any-to-any", model="Gen-Verse/MMaDA-8B-Base")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון mit, וזה פותח כמעט כל דלת אפשרית. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצר סגור ולהפיץ אותו הלאה, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים וכתב הוויתור של הרישיון המקורי בתוך העותקים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗