GPT
B

BAGEL-7B-MoT

קוד פתוח

ByteDance-Seedapache-2.02025-05-19

  • bagel-mot
  • safetensors
  • bagel
  • any-to-any

מודל יחיד שמחזיק הבנת תמונה, יצירת תמונות מטקסט ועריכה גרפית חופשית. הוא פותר את הצורך להחזיק מודל ראייה נפרד ומודל דיפוזיה נפרד.

  • 15Bפרמטרים
  • 27.5 GBמשקל הקבצים
  • 961הורדות בחודש
  • 1,215לייקים

מה זה

הארכיטקטורה כאן מחברת הבנה ויצירה תחת מנגנון אחד של חיזוי הטוקן הבא. יש לו 14,691,079,811 פרמטרים בסך הכול, מתוכם 7B אקטיביים בזכות שימוש במומחים. המערכת משלבת קידוד פיקסלים דרך רכיב הראייה של FLUX.1-schnell לצד קידוד סמנטי של תמונות, מה שמאפשר לו לעשות מניפולציות חזותיות מורכבות כמו חיזוי פריים עתידי, סינתזה של כמה זוויות ראייה וניווט.

במבחני יצירה הוא עקף מודלים ייעודיים עם תוצאה של 0.88 במדד GenEval מול 0.82 של FLUX-1-dev. בהבנה חזותית הוא קיבל 73.1 ב־MathVista וגבר על Qwen2.5-VL-7B, אם כי במבחן MMMU הוא נשאר מאחוריו עם 55.3 לעומת 58.6.

מתאים ל

  • עריכת תמונות מונחית טקסט

    ביצוע שינויים מורכבים בתמונה קיימת על בסיס הוראה מילולית, עם תוצאה של 7.36 במדד GEdit-Bench-EN.

  • הבנת מסמכים ותרשימים

    פענוח תמונות שדורשות חישוב והיגיון מתמטי בזכות ציון של 73.1 במבחן MathVista.

  • יצירת תמונות מטקסט

    ייצור תמונות באיכות גבוהה ישירות מפקודת טקסט עם ציון 0.88 במדד GenEval.

איפה זה נופל

במבחן MMMU להבנה רב-תחומית המודל משיג 55.3 ומפסיד ל־Qwen2.5-VL-7B. בנוסף, בעריכה חכמה מורכבת לפי IntelligentBench הוא מגיע ל־44.0 בלבד ללא שרשרת מחשבה, נמוך בהרבה מ־Gemini-2-exp שמציג 57.6, ומטפס ל־55.3 רק כשמפעילים מצב חשיבה ייעודי. כרטיס המודל גם לא מציג נתונים לגבי תמיכה בשפות שאינן אנגלית או לגבי ביצועים בעברית.

שאלות
נפוצות

האם המודל תומך בעברית?

החומר שפורסם לא מציג שום מידע או מבחני ביצועים בשפה העברית. הבסיס שלו כולל רכיבים כמו Qwen2.5-7B-Instruct, אך ללא בדיקה עצמאית של הטקסט והיצירה אי אפשר להסתמך עליו לעברית.

למה יש שני נתוני גודל שונים, 7B ו־14B?

בארכיטקטורה הזו יש בסך הכול כ־15 מיליארד פרמטרים, אך בכל צעד חישוב מופעלים רק כ־7 מיליארד מהם. זה מאפשר לקבל קיבולת זיכרון וידע רחבה יותר בלי להכפיל את כמות החישובים בכל טוקן.

איך מריצים

הקבצים שוקלים 27.5 גיגה בפורמט bfloat16 ומחולקים ל־14 חלקים. המודל דורש התקנה של הספרייה bagel-mot וקוד תואם ממאגר הגיטהאב של הפרויקט, ולא נתמך ישירות דרך ספריות סטנדרטיות בלי ההתאמות האלה.

אם אתם צריכים רק משימה אחת, כמו יצירת תמונה פשוטה או תיאור של צילום, מודל ייעודי קטן יותר יעשה את זה בפחות משאבים. להרצה מקומית מלאה תידרשו להחזיק חומרה שמסוגלת לטעון את כל המשקלים האלה לזיכרון הגרפי.

pip install -U huggingface_hub
hf download ByteDance-Seed/BAGEL-7B-MoT

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו, בכפוף לשמירה על תנאי הרישיון ומתן קרדיט ליוצרים. המודלים שמהם הוא אומן, כולל רכיב הראייה, מבוססים כולם על גרסאות באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗