GPT
L

llava-v1.5-13b

קוד פתוח

liuhaotianרישיון לא דווח2023-10-05

  • transformers
  • pytorch
  • llava
  • text-generation
  • image-text-to-text

החיבור בין ראייה ממוחשבת למודל שפה של 13 מיליארד פרמטרים נותן מענה למי שרוצה צ'אט שמבין תמונות. הוא מתאים למי שמחפש פתרון קוד פתוח מוכח למחקר וניסויים.

  • 4,096טוקנים בהקשר
  • 24.4 GBמשקל הקבצים
  • 11,929הורדות בחודש
  • 529לייקים

מה זה

מדובר במודל שמשלב טקסט ותמונה ומבוסס על ארכיטקטורת LlavaLlamaForCausalLM עם 40 שכבות וחלון הקשר של 4,096 טוקנים. הוא אומן בספטמבר 2023 על גבי LLaMA ו־Vicuna, תוך שימוש בדאטה רב של מעקב אחר הוראות שנוצר על ידי GPT, לצד מאות אלפי דוגמאות של זוגות תמונה וטקסט ושאלות על תמונות.

האימון כלל 558 אלף זוגות תמונה-טקסט מפולטרים עם כתוביות של BLIP, עוד 158 אלף דוגמאות מולטימודליות של הוראות, 450 אלף שאלות ותשובות אקדמיות על תמונות, ו־40 אלף שיחות מ־ShareGPT. השילוב הזה בנה כלי שמסוגל לענות על שאלות מורכבות סביב תמונה ולא רק לתאר אותה באופן שטחי.

מתאים ל

  • מחקר אקדמי במולטימודל

    הוא נבנה במקור עבור חוקרים בתחום הראייה הממוחשבת ואינטראקציית תמונה-טקסט.

  • ניתוח והבנת תמונות

    האימון על 450 אלף דוגמאות VQA מאפשר לו לענות על שאלות מורכבות לגבי תמונה.

  • ניסוי בצ'אט מבוסס ראייה

    שילוב הדאטה מ־ShareGPT ודוגמאות ה־GPT נותן מענה טוב לשיחה טבעית סביב תמונות.

איפה זה נופל

היוצרים מגדירים את קהל היעד העיקרי כחוקרים וחובבים בתחומי הראייה הממוחשבת ועיבוד השפה הטבעית, מה שאומר שהוא לא נבנה כמוצר צריכה מלוטש. חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, כך ששיחות ארוכות או ניתוח של טקסטים עמוסים בתוך תמונות יגיעו מהר לתקרה. בנוסף, האימון התבסס בחלקו הגדול על תוכן סינתטי שיצר GPT ועל נתוני ShareGPT, מה שעלול לייצר טעויות עובדתיות בהבנת פרטים חזותיים עדינים.

אותה משפחה

llava יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה מקום ומשאבים צריך כדי להוריד ולהריץ אותו?

המשקלים תופסים 24.4 גיגה-בייט שמחולקים ל־12 קבצים בדיוק float16. תצטרכו כרטיס גרפי עם זיכרון וידאו מספק כדי להעלות את כל 40 השכבות של המודל לזיכרון.

האם המודל מתאים לפיתוח מוצר מסחרי?

בדף המודל לא דווח רישיון ישיר, אך מופיע אזכור לרישיון של Llama 2. בנוסף המפתחים מייעדים אותו בעיקר למחקר ולחובבים, כך שכדאי להיזהר משימוש מסחרי ישיר.

איך מריצים

כדי להריץ אותו מקומית דרך ספריית transformers תצטרכו להוריד 24.4 גיגה-בייט שמחולקים ל־12 קבצים, כולם בדיוק של float16. המשקל הזה דורש כרטיס מסך עם זיכרון ייעודי גדול מספיק כדי להחזיק את כל המשקלים וההקשר בזמן עיבוד.

אם אין לכם חומרה חזקה פנויה, הטרחה של פריסה עצמית ותחזוקת שרת כבד פשוט לא משתלמת. במקרים כאלה עדיף לפנות ל־API חיצוני שמארח מודלים מולטימודליים ולשלם לפי קריאה במקום להחזיק ברזל יקר.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="liuhaotian/llava-v1.5-13b")
print(pipe("שלום"))

הרישיון

בעמוד המודל עצמו לא דווח רישיון ספציפי, אך בכרטיס מוזכר רישיון הקהילה של Llama 2 מבית Meta שעליו הוא נשען. חוסר הבהירות לגבי הרישיון המדויק של החבילה כולה מהווה סיכון משפטי, ולכן לא מומלץ לשלב אותו במוצר מסחרי בלי בדיקה מעמיקה של תנאי השימוש המקוריים.

הרישיון המלא בעמוד המודל ↗