GPT
E

Emu3-Gen

קוד פתוח

BAAIapache-2.02024-09-25

  • transformers
  • safetensors
  • Emu3
  • text-generation
  • any-to-any

מודל מולטימודלי שמייצר תמונות, וידאו וטקסט רק בעזרת חיזוי הטוקן הבא, בלי מודלי דיפוזיה. הוא מושך למי שמחפש ארכיטקטורה אחת פשוטה שעושה הכול.

  • 8.5Bפרמטרים
  • 9,216טוקנים בהקשר
  • 31.6 GBמשקל הקבצים
  • 1,170הורדות בחודש

מה זה

במקום לחבר מודל שפה קיים למודל דיפוזיה חיצוני, המודל הזה מאמן ארכיטקטורת טרנספורמר יחידה מאפס על רצפים של טקסט, תמונה ווידאו שהומרו כולם לטוקנים בדידים. המטרה היא להוכיח שחיזוי הטוקן הבא מספיק לכל המשימות המולטימודליות, בלי צורך במודלים ייעודיים כמו קליפ או מנגנוני דיפוזיה מורכבים.

הוא מסוגל לקבל טקסט וליצור תמונה ברזולוציות ובסגנונות משתנים, להבין תמונות ולענות על שאלות לגביהן, ואפילו לייצר וידאו או להמשיך קטע וידאו קיים בצורה סיבתית. לפי המפתחים, הגישה הזו עוקפת בביצועים מודלים פתוחים מובילים כמו SDXL ביצירת תמונות, LLaVA 1.6 בהבנה חזותית, ו־OpenSora 1.2 בווידאו, הכל תחת רשת אחת של 8.5 מיליארד פרמטרים.

מתאים ל

  • יצירת תמונות מטקסט

    מתאים למי שרוצה לייצר תמונות בסגנונות ורזולוציות שונות בלי לתחזק צינור עיבוד נפרד של דיפוזיה.

  • המשך ועריכת וידאו

    הארכיטקטורה הסיבתית חוזה את הפריימים הבאים ומאפשרת להמשיך קטעי וידאו קיימים ברצף עקבי.

  • הבנת תמונה ושיחה

    הוא מנתח את העולם הפיזי בתמונה ומחזיר תשובות טקסטואליות בלי תלות במודל ראייה חיצוני.

איפה זה נופל

הכרטיס לא מפרט נתוני מהירות, אבל יצירת תמונה או וידאו טוקן אחרי טוקן בארכיטקטורת שפה היא תהליך כבד ואיטי משמעותית בהשוואה לחלק ממודלי הדיפוזיה הממוטבים. מעבר לכך, אין פירוט לגבי ביצועים בשפות שאינן אנגלית, אין שום התייחסות לעברית, והעובדה שמדובר בארכיטקטורה לא שגרתית דורשת בדיקה מעמיקה של איכות התוצרים בפועל לפני שמסתמכים עליה.

שאלות
נפוצות

האם המודל צריך מודל שפה נפרד או כלי דיפוזיה כדי לעבוד?

לא. מדובר ברשת אחת שמאומנת מאפס על טוקנים של טקסט, תמונה ווידאו יחד, כך שאין צורך בחיבור של רכיבים חיצוניים כמו קליפ או מנועי דיפוזיה.

כמה זיכרון וידאו צריך כדי להריץ אותו מקומית?

המשקלים שוקלים מעל 31 גיגה בייט בקבצים המקוריים, לכן תצטרכו כרטיס מסך של לפחות 40 גיגה בייט זיכרון כדי לטעון אותו, או להמתין לגרסאות מכווצות ומכומתות.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־31.6 גיגה בייט בגלל שמירת המשקלים בדיוק המקורי, מה שאומר שתצטרכו כרטיס מסך חזק מאוד, לפחות A100 או H100 עם 40 או 80 גיגה זיכרון כדי לטעון אותו ולהריץ הסקת מסקנות בצורה יציבה.

ההרצה מתבצעת ישירות דרך ספריית transformers, אבל אם אין לכם גישה לשרת ייעודי עם כרטיס תואם, תשלום על שרת ענן לפי שעה או פנייה לפתרון שמארח אותו דרך API יהיו זולים בהרבה מלהחזיק חומרה כזו במשרד.

from transformers import pipeline

pipe = pipeline("any-to-any", model="BAAI/Emu3-Gen")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון אפאצ'י 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה חופשית, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הוויתור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗