GPT
E

Emu3-VisionTokenizer

קוד פתוח

BAAIapache-2.02024-09-25

  • transformers
  • safetensors
  • Emu3VisionVQ
  • feature-extraction
  • custom_code

רכיב ויזואלי קל משקל שהופך תמונות וסרטונים לרצף אסימונים בדידים. הוא נבנה כבסיס למודלים מולטימודליים שחוזים את הטוקן הבא במקום להסתמך על דיפוזיה.

  • 271Mפרמטרים
  • 1.0 GBמשקל הקבצים
  • 2,293הורדות בחודש
  • 63לייקים

מה זה

מדובר ברכיב מסוג טוקנייזר ויזואלי מבוסס ארכיטקטורת Emu3VisionVQModel, שתפקידו לפרק תוכן של תמונה או וידאו לייצוג מספרי בדיד. בניגוד לגישות המקובלות שמחברות מודל שפה עם מודל דיפוזיה או אנקודר חיצוני כמו CLIP, הרכיב הזה מאפשר לאמן רשת טרנספורמר יחידה מאפס על רצפים מעורבים של טקסט ומדיה.

המטרה שלו היא לאפשר גם הבנה וגם יצירה של תמונות ווידאו ישירות דרך חיזוי הטוקן הבא ברצף. לפי הפרסום של צוות הפיתוח, הארכיטקטורה הכוללת משיגה ביצועים טובים יותר ממודלים ייעודיים כמו SDXL ביצירה, LLaVA-1.6 בהבנה, ו־OpenSora-1.2 בייצור וידאו. הטוקנייזר עצמו אחראי על קידוד המידע הוויזואלי לחלל המשותף הזה בלי לאבד את הפרטים החיוניים, ובכך הוא מנתק את התלות בארכיטקטורות מורכבות ומרובות חלקים.

מתאים ל

  • קידוד תמונות למודל שפה

    המרה של קובצי תמונה לרצף אסימונים בדידים שאפשר להזין ישירות לטרנספורמר שפה.

  • שחזור וידאו מאסימונים

    פענוח של רצפי טוקנים ויזואליים בחזרה לווידאו במסגרת אימון מערכות חיזוי.

  • חילוץ מאפיינים ויזואליים

    הפקת ייצוגים מתומצתים של מדיה לפרויקטים מקומיים ללא תלות באנקודר של CLIP.

איפה זה נופל

זה רק טוקנייזר למשימת feature extraction, ולא המודל המולטימודלי המלא. הוא לא יודע לייצר תמונות מטקסט לבדו ולא יענה לכם על שאלות לגבי תמונה. כדי לקבל תוצאות של יצירה או הבנה תצטרכו לחבר אותו למודל Emu3 הגדול יותר, כך שאם אתם מחפשים פתרון עצמאי שפועל מהקופסה, הקובץ הזה לא יספיק לכם.

שאלות
נפוצות

האם המודל הזה יכול לייצר לי תמונה מטקסט?

לא. מדובר ברכיב טוקנייזר בלבד שממיר תמונות לאסימונים ומפענח אותם חזרה. כדי לייצר תמונה צריך את מודל השפה המלא של Emu3.

האם צריך כרטיס מסך חזק כדי להריץ אותו?

לא, הוא שוקל ג'יגה בייט אחד ומכיל כ־271 מיליון פרמטרים. כל כרטיס מסך פשוט או אפילו מעבד רגיל יספיקו כדי להריץ את הקידוד.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers הרגילה בפייתון. עם משקל קבצים של ג'יגה בייט בודד ופחות מ־271 מיליון פרמטרים, הדרישות שלו צנועות מאוד והוא ירוץ בלי בעיה על כרטיס מסך בסיסי או אפילו על מעבד רגיל של שרת מקומי, גם בדיוק המקורי של float32.

אין סיבה לשלם ל־API חיצוני עבור פעולת טוקניזציה כזו קלה. אתם מורידים את שמונת הקבצים פעם אחת ומריצים את פעולת הקידוד והשחזור אצלכם בתוך הצינור המקומי.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="BAAI/Emu3-VisionTokenizer")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי מלא, הפצה, שינוי קוד ושילוב במוצרים סגורים. אתם נדרשים לשמור על קרדיט למפתחים המקוריים ב־BAAI ולצרף עותק של תנאי הרישיון, אבל אין שום חובה לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗