GPT
E

Emu3.5

קוד פתוח

BAAIapache-2.02025-10-31

  • transformers
  • safetensors
  • Emu3
  • text-generation
  • any-to-any

מודל מולטימודלי של 34B שמייצר ומנתח טקסט ותמונות ברצף אחד, ללא מתאמים חיצוניים. הוא מתאים למי שרוצה להפיק תוכן מעורב של תמונה וטקסט תחת ארכיטקטורה אחידה.

  • 34Bפרמטרים
  • 32,768טוקנים בהקשר
  • 63.5 GBמשקל הקבצים
  • 383הורדות בחודש

מה זה

במקום לחבר מודל שפה למודל דיפוזיה נפרד, הארכיטקטורה הזו מתייחסת לטוקנים חזותיים ולטוקנים של טקסט באותה צורה בדיוק, דרך חיזוי הטוקן הבא. האימון הראשוני כלל מעל עשרה טריליון טוקנים מרצפי וידאו ותמלולים, ומעליו בוצע כוונון בעזרת למידת חיזוק כדי לשפר הסקה והרכבת קומפוזיציות.

הוא מסוגל לקבל טקסט ותמונות ולהחזיר רצפים מתחלפים שמערבבים תיאורים ותמונות, תסריטים מונחים, או יצירת תמונה בודדת. לפי נתוני המפתחים, במשימות של רצף משולב הוא עוקף את Gemini 2.5 Flash Image, ובמשימות יצירת ועריכת תמונה בודדת הוא משתווה אליו.

מתאים ל

  • מדריכים מאוירים ברצף

    יצירה ישירה של שלבי עבודה שבהם הסבר כתוב ותמונה תואמת מופקים ברצף לוגי אחד.

  • סיפורים ויזואליים

    יצירת עלילה מתמשכת המשלבת טקסט ותמונות תוך שמירה על עקביות דרך חלון הקשר של 32K.

  • עריכת תמונה על בסיס קלט

    קבלת תמונת מקור והוראות טקסטואליות כדי להוציא תמונה חדשה מותאמת.

איפה זה נופל

המשקל הנוכחי הוא חיזוי טוקן קלאסי ללא מנגנון האצה מסוג DiDA, שנמצא עדיין בפיתוח. המשמעות בפועל: יצירת תמונה בודדת עלולה לקחת מספר דקות תמימות. בנוסף, אם היעד שלכם הוא יצירת תמונה בודדת מטקסט בלבד, המפתחים בעצמם ממליצים להשתמש בגרסת Image הייעודית ולא במודל הכללי הזה. הפלט גם דורש פענוח של קובצי Protobuf באמצעות סקריפט ייעודי, מה שמוסיף שכבת עיבוד בקוד.

שאלות
נפוצות

כמה זמן לוקח לייצר תמונה במודל הזה?

בגרסה הזו יצירת תמונה אחת עשויה לקחת כמה דקות. המודל פועל כרגע על חיזוי טוקנים עוקב ואינו כולל עדיין את משקלי הזירוז של מנגנון הדיפוזיה הדיסקרטי שנמצא ברשימת התוכניות של הפרויקט.

באיזו גרסה לבחור ליצירת תמונות רגילות מטקסט?

עבור תמונה בודדת מטקסט עדיף להוריד את Emu3.5-Image. המודל הראשי מיועד בעיקר למשימות של רצף משולב של טקסט ותמונה, כמו מדריכים או נרטיבים ארוכים.

איך מריצים

כדי להריץ מודל של 34B במשקל 63.5GB בפורמט bfloat16, כרטיס בודד רגיל לא יספיק. המפתחים ממליצים במפורש על לפחות שני מעבדים גרפיים, כשהסביבה נשענת על Python 3.12 ומודול Flash Attention.

יש תמיכה בהרצה דרך vLLM 0.11.0 עם תזמון מותאם שמשפר את המהירות פי 4 או 5, וגם ממשקי Gradio לבדיקות מקומיות. אם אין לכם שרת ייעודי עם חומרה חזקה, המפתחים מציעים אפליקציית ווב ומובייל פעילה שחוסכת את ההקמה.

from transformers import pipeline

pipe = pipeline("any-to-any", model="BAAI/Emu3.5")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי, שינוי קוד והפצה חופשית. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקוד ובתוצרים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗