GPT
I

instructblip-vicuna-7b

קוד פתוח

Salesforceother2023-05-22

  • transformers
  • pytorch
  • safetensors
  • instructblip
  • image-text-to-text

חיבור ישיר בין ראייה ממוחשבת למודל שפה של שבעה מיליארד פרמטרים. מתאים למי שרוצה לתשאל תמונות באנגלית לפי הוראות מדויקות על תשתית מקומית.

  • 7.9Bפרמטרים
  • 59.0 GBמשקל הקבצים
  • 10,022הורדות בחודש
  • 102לייקים

מה זה

מדובר בגרסה שעברה כוונון לפי הוראות על בסיס BLIP-2, כאשר מנוע השפה הפנימי שמייצר את הטקסט הוא Vicuna-7b. המבנה הזה נועד לקחת תמונה, לקבל הנחיה חופשית בטקסט, ולהחזיר תשובה שמתייחסת בדיוק למה שביקשתם לראות בה ולא רק לתאר אותה באופן כללי.

במקום סתם לתת כיתוב לתמונה כמו מודלי ראייה ישנים יותר, הוא מסוגל לענות על שאלות מורכבות על תוכן ויזואלי. השילוב עם מודל שפה בגודל כזה נותן לו יכולת ניסוח טובה, אבל הוא מוגבל לשפה האנגלית בלבד ולא מכיר עברית.

מתאים ל

  • מענה לשאלות על תמונות

    מאפשר לשאול שאלות ממוקדות באנגלית על פרטים בתוך תמונה ולקבל תשובה ישירה.

  • חילוץ מידע לפי הנחיה

    מבצע הוראות טקסטואליות לניתוח סצנות ויזואליות במקום להסתפק בתיאור כללי.

  • מחקר אקדמי במולטימודל

    מתאים לבחינת היכולות של חיבור בין BLIP-2 למודלי שפה ממשפחת Vicuna.

איפה זה נופל

בכרטיס מצוין בפירוש שהשחרור מיועד למחקר בלבד סביב המאמר האקדמי, והוא לא נבדק למשימות קצה ספציפיות. הוא לא עבר התאמה לתרחישים רגישים שבהם טעויות עלולות לפגוע באנשים, ואינו כולל תמיכה מובנית בשפות שאינן אנגלית. בנוסף, הצוות המקורי מ־Salesforce כלל לא כתב את כרטיס המודל אלא אנשי Hugging Face, כך שאין כאן פירוט של שיעורי שגיאות או הטיות שנמדדו.

אותה משפחה

instructblip-vicuna יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו כדי לנתח תמונות עם טקסט בעברית?

לא. המודל הוגדר ואומן עבור השפה האנגלית בלבד. פקודות בעברית או ניסיון לקרוא טקסט עברי מתוך תמונה פשוט לא יעבדו בצורה תקינה.

למה הקבצים שלו שוקלים כמעט 60 גיגה אם הוא מוגדר כ־7B?

המשקלים נשמרו בפורמט float32 שתופס 4 בייטים לכל פרמטר, לצד משקלי רכיב הראייה של BLIP-2. כדי להריץ אותו בלי לשרוף משאבים, תצטרכו להמיר אותו לחצי דיוק או לבצע קוונטיזציה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־59 גיגה־בייט בגלל ייצוג float32, כך שתצטרכו כרטיס מסך חזק מאוד עם שפע זיכרון ייעודי כדי לטעון אותו ישירות מהספרייה של transformers. בלי כיווץ לדיוק נמוך יותר, כרטיס ביתי פשוט ייחנק מיד מהמשקל הזה.

אם אתם רק רוצים לבדוק איך הוא מנתח תמונות בודדות ולא בונים מערכת פנימית שחייבת לרוץ על שרתים מקומיים, שווה לשקול קריאה לשירות קיים במקום להוריד 26 קבצים כבדים ולהחזיק חומרה יקרה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Salesforce/instructblip-vicuna-7b")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other, והחוקרים מבהירים שהמודל מיועד למטרות מחקר בלבד ולא נבנה לשימוש מסחרי רחב. אם אתם מתכננים לשלב אותו במוצר מסחרי, הרישיון הזה מהווה בעיה ממשית ותצטרכו לבדוק את תנאי השימוש של Vicuna והמדיניות של Salesforce לפני שאתם מתקדמים.

הרישיון המלא בעמוד המודל ↗