GPT
B

blip2-opt-6.7b

קוד פתוח

Salesforcemit2023-02-07

  • transformers
  • pytorch
  • safetensors
  • blip-2
  • visual-question-answering

שילוב של מודל שפה עם מעבד תמונה שמבין הקשר ויזואלי ומייצר טקסט בהתאם. הוא מעניין בעיקר למי שרוצה בסיס פתוח למחקר או פיתוח משימות ראייה ממוחשבת באנגלית.

  • 7.8Bפרמטרים
  • 58.5 GBמשקל הקבצים
  • 11,460הורדות בחודש
  • 80לייקים

מה זה

הארכיטקטורה כאן מחברת מקודד תמונה בסגנון קליפ אל מודל השפה אופט עם 6.7 מיליארד פרמטרים. במקום לאמן את שניהם מחדש מאפס, החוקרים הקפיאו את המשקלים שלהם והשתמשו במתווך שנקרא קיו פורמר. הרכיב הזה לוקח את הייצוגים הוויזואליים ומתרגם אותם לטוקנים שמודל השפה מבין, כדי שיוכל לנחש את המילה הבאה.

בפועל אתם מקבלים כלי שיודע לקבל תמונה וטקסט, ולייצר טקסט חופשי בתגובה. זה מתאים לכתיבת תיאורים לתמונות, מענה לשאלות על תוכן ויזואלי ושיחה פשוטה שמתבססת על תמונה והיסטוריית הדיאלוג. חשוב להבין שזו גרסת קדם אימון בסיסית בלבד, ולא גרסה שעברה התאמה ייעודית למשימה אחת ספציפית.

מתאים ל

  • תיאור תמונות באנגלית

    הפקת כיתובים וטקסט תיאורי מקבצי תמונה באופן אוטומטי על בסיס חיבור הראייה והשפה.

  • מענה לשאלות על תמונות

    קבלת שאלה מילולית יחד עם תמונה והחזרת תשובה טקסטואלית על מה שמופיע בה.

  • מחקר על חיבור ראייה ושפה

    בסיס פתוח שמאפשר לחקור איך גשר הקידוד מעביר מידע ויזואלי למודל שפה קפוא.

איפה זה נופל

זהו שחרור מחקרי שלא נבדק ביישומים בעולם האמיתי, והיוצרים מציינים במפורש שלא כדאי לפרוס אותו ישירות במוצר פעיל. הוא יורש את כל הבעיות של מודל השפה אופט, כולל הזיות, חוסר גיוון ביצירת הטקסט, והטיות שמגיעות ממאגרי אינטרנט כמו לאיון. הוא תומך באנגלית בלבד, כך שלשימוש בעברית תצטרכו לתרגם את הקלט והפלט מסביב.

אותה משפחה

blip2-opt יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית מהקופסה?

לא. המודל מוגדר ומאומן באנגלית בלבד. אם תזינו לו טקסט בעברית הוא כנראה ייכשל או ייצר פלט שבור, ולכן חייבים לתרגם את השאלות והתשובות חיצונית.

האם אפשר להשתמש בו ישירות באפליקציה שלי?

התיעוד ממליץ בפירוש לא להעלות אותו למוצר פעיל בלי בדיקות קפדניות. מדובר במודל בסיס שנועד למחקר, ויש לו נטייה להזיות ופליטת תוכן מוטה.

כמה זיכרון וידאו דרוש להרצה מקומית?

בגלל שהקבצים נשמרים בדיוק המקורי ושוקלים מעל 58 גיגה בייט, תצטרכו שרת ייעודי עם כרטיסי מסך חזקים במיוחד בעלי נפח וי רם כולל של לפחות 60 עד 80 גיגה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־58.5 גיגה בייט בדיוק של פלואוט 32, מה שאומר שצריך חומרה כבדה מאוד רק כדי לטעון אותו לזיכרון. כרטיס מסך ביתי רגיל לא יספיק פה בלי להמיר את הדיוק או לפצל את הריצה, ותצטרכו שרת עם זיכרון גרפי נדיב כדי לעבוד איתו בצורה מקומית דרך ספריית טרנספורמרס.

אם אתם לא צריכים גישה ישירה למשקלים כדי לבצע מחקר או אימון המשך, עדיף להשתמש בפתרון ענן מנוהל או לקרוא לשירות מוכן. הורדה של 22 קבצים בהיקף כזה והחזקת שרת ייעודי רק בשביל שאילתות בודדות היא מהלך יקר ומסורבל עבור רוב הצרכים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Salesforce/blip2-opt-6.7b")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון אם אי טי. מדובר ברישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חוזרת, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. עם זאת, היוצרים מדגישים בתיעוד שמבחינתם השחרור נועד למטרות מחקר בלבד סביב המאמר האקדמי, כך שחובת בדיקות הבטיחות וההתאמה למוצר חלה עליכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗