GPT
X

xgen-mm-phi3-mini-instruct-r-v1

קוד פתוח

Salesforcecc-by-nc-4.02024-05-06

  • transformers
  • safetensors
  • xgenmm
  • feature-extraction
  • image-text-to-text

מודל ראייה ושפה קומפקטי שמביא יכולות של סדרת BLIP לתוך ארכיטקטורה מבוססת Phi-3. הוא מתאים למי שחייב מודל מולטימודלי מקומי ולא רוצה להחזיק משקלים כבדים.

  • 4.6Bפרמטרים
  • 17.1 GBמשקל הקבצים
  • 202הורדות בחודש
  • 185לייקים

מה זה

מדובר במודל מולטימודלי בגודל 4.6 מיליארד פרמטרים שמחבר בין עיבוד תמונה לטקסט, וממשיך את הפיתוח של משפחת BLIP תחת המיתוג החדש של Salesforce. הוא עבר כוונון להוראות ומיועד לענות על שאלות לגבי תמונות, לנתח דיאגרמות ולחלץ מידע חזותי. המודל כולל תמיכה בקידוד תמונות ברזולוציה גבוהה עם דגימה יעילה של טוקנים חזותיים.

במבחני ביצועים מול מודלים אחרים באותו סדר גודל, כמו MiniCPM-V-2 או llava-phi-3-mini, הוא מוביל ברוב המדדים המשמעותיים. הוא קיבל 74.1 ב־MMBench לעומת פחות מ־70 אצל המתחרים, והגיע ל־75.8 במבחן הדיאגרמות AI2D. המשמעות בפועל היא הבנה עדיפה של פרטים קטנים וטקסט שמופיע בתוך תמונה, למרות שהציון שלו ב־MMMU נמוך מעט מחלק מהחלופות.

מתאים ל

  • ניתוח דיאגרמות ותרשימים

    המודל קיבל ציון של 75.8 במבחן AI2D, מה שהופך אותו לבחירה טובה לחילוץ מידע מתרשימים טכניים באנגלית.

  • מענה על שאלות מתמונות

    הוא מציג יכולת גבוהה במבחני MMBench ו־MME, ומתאים למחקר של מערכות VQA קומפקטיות שמנתחות סצנות מורכבות.

  • מחקר על דגימת טוקנים

    מבנה המודל כולל דגימת טוקנים חזותיים יעילה, שמתאימה לחוקרים שבוחנים התייעלות חישובית של מודלי ראייה-שפה.

איפה זה נופל

המודל אומן על מידע באנגלית בלבד ולכן הוא אינו מתאים לעבודה בעברית. המפתחים מציינים מפורשות שהרזולוציה המקורית של התמונה משפיעה באופן ניכר על התשובות שלו, כך ששינוי גודל או איכות עלול לשבש את הפלט לחלוטין. הוא נשען על נתונים שנאספו מהרשת וסובל מהטיות ומחוסר דיוק שמוכרים במודלי שפה, ולכן חובה לבדוק אותו מקרוב לפני שמשלבים אותו במערכות אוטומטיות.

שאלות
נפוצות

האם המודל מבין תמונות שכוללות טקסט בעברית?

לא. המודל הוגדר ואומן על שפה אנגלית בלבד. הוא לא יזהה נכון טקסט עברי בתוך תמונות וכנראה ייכשל לחלוטין אם תשאלו אותו שאלות בעברית.

איך משפיעה איכות התמונה על התשובות?

החוקרים של Salesforce ציינו שרזולוציית התמונה הגולמית משפיעה באופן מורגש על הפלט. מומלץ להזין תמונות באיכות טובה ולא להקטין אותן בצורה אגרסיבית מדי לפני השליחה למודל.

האם אפשר להטמיע את המודל באפליקציה בתשלום ללקוחות?

לא באופן ישיר. הרישיון הוא לא מסחרי, כך שחובה למלא טופס פנייה מול Salesforce כדי לקבל אישור חריג לפני שימוש במוצר מסחרי.

איך מריצים

המשקלים שפורסמו נשמרו בפורמט float32 ותופסים 17.1 גיגה בייט ב־32 קבצים נפרדים. כדי לטעון אותו כמו שהוא צריך כרטיס מסך עם זיכרון משמעותי, מעל 24 גיגה בייט, אלא אם מבצעים קוונטיזציה לפורמטים קלים יותר כמו fp16 או שמונה ביט. המודל נתמך ישירות דרך ספריית transformers החל מגרסה 4.41.1, אך דורש תלויות ספציפיות כמו open_clip_torch ו־einops.

אם כל מה שאתם צריכים זה לחלץ טקסט פשוט מתמונות או מענה מדי פעם, עדיף להשתמש ב־API מנוהל וחזק יותר. הרצה עצמית שווה את הטרחה רק אם אתם חייבים שהמידע יישאר מקומית ולא ייצא לרשת, או אם אתם עורכים מחקר מותאם אישית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Salesforce/xgen-mm-phi3-mini-instruct-r-v1")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים זמינים תחת רישיון cc-by-nc-4.0. הרישיון הזה מתיר שימוש למחקר, בדיקות ופיתוח פנימי בלבד, ואוסר כל שימוש מסחרי ישיר או שילוב במוצר שמייצר הכנסה. מי שמעוניין להשתמש בו באופן מסחרי נדרש לפנות ל־Salesforce דרך טופס ייעודי לקבלת אישור.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗