GPT
L

llava-v1.5-7b

קוד פתוח

liuhaotianרישיון לא דווח2023-10-05

  • transformers
  • pytorch
  • llava
  • text-generation
  • image-text-to-text

חיבור ישיר בין ראייה ממוחשבת למודל שפה של 7 מיליארד פרמטרים. פתרון קלאסי למי שרוצה לעבד תמונות עם טקסט מקומית בלי לשלוח דאטה החוצה.

  • 4,096טוקנים בהקשר
  • 12.6 GBמשקל הקבצים
  • 279,449הורדות בחודש
  • 561לייקים

מה זה

מדובר בארכיטקטורה שמחברת מודל שפה מסוג LLaMA או Vicuna למעבד תמונה, ועברה אימון על הוראות מולטימודליות שנוצרו בעזרת GPT. המודל מקבל תמונה וטקסט יחד, ועונה בטקסט חופשי. הוא כולל 32 שכבות ומבוסס על שילוב של מאגרי VQA אקדמיים, כחצי מיליון זוגות תמונה-טקסט מסוננים, ושיחות מ־ShareGPT כדי לשמור על יכולת שיחה טבעית.

היתרון שלו הוא היכולת לנהל שיחה אמיתית סביב תמונה ולא רק לפלוט תגיות בסיסיות. עם חלון הקשר של 4,096 טוקנים, הוא מתמודד יפה עם שאלות מורכבות על פרטים מתוך תמונות, אבל הוא עדיין מודל קומפקטי יחסית שלא מתחרה בעומק של ענקים מסחריים.

מתאים ל

  • מענה על שאלות מתמונות

    מאפשר לשאול שאלות מורכבות על תוכן ויזואלי ולקבל הסבר מפורט באנגלית.

  • מחקר וניסוי מקומי

    רץ ישירות דרך transformers על כרטיס מסך ביתי חזק לצורכי בדיקות ופיתוח.

  • חילוץ תיאורים לקטלוג

    מייצר תיאורי מוצר טקסטואליים מתוך תמונות על בסיס הנחיות מוגדרות.

איפה זה נופל

יוצרי המודל הגדירו אותו מראש למחקר ולחובבים, ולא למוצר ייצורי. הוא אומן על מידע שיוצר בחלקו על ידי GPT, ולכן הוא נוטה להזיות, במיוחד בזיהוי פרטים קטנים או קריאת טקסט צפוף מתוך תמונה. חלון של 4,096 טוקנים גם מגביל אם רוצים להעמיס היסטוריית שיחה ארוכה לצד תמונות מרובות.

אותה משפחה

llava יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב בלי כרטיס מסך ייעודי?

טכנית אפשר דרך המעבד בלבד, אבל זה יהיה אטי להחריד. מעבד גרפי עם מספיק VRAM חיוני כאן כדי לקבל זמני תגובה סבירים.

האם המודל מתאים לעבודה בעברית?

האימון התבסס בעיקר על אנגלית ונתוני ראייה ממוחשבת בינלאומיים. הוא עשוי להבין מעט עברית, אבל הביצועים האמיתיים שלו מוגבלים כמעט לחלוטין לאנגלית.

איך מריצים

המשקלים שוקלים 12.6 גיגה ב־float16, כך שתצטרכו כרטיס מסך עם לפחות 16 גיגה זיכרון כדי להריץ אותו כמו שצריך בלי כיול, או כרטיס של 8 גיגה אם תשתמשו בקוונטיזציה. הוא רץ ישירות דרך ספריית transformers עם ארכיטקטורת LlavaLlamaForCausalLM.

אם אתם צריכים רק בדיקה מהירה של כמה עשרות תמונות ביום, עדיף להשתמש ב־API מנוהל במקום להחזיק שרת יקר באוויר. החישוב העצמי משתלם כשרוצים פרטיות מוחלטת או כשיש נפח קריאות קבוע שמצדיק את הברזל.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="liuhaotian/llava-v1.5-7b")
print(pipe("שלום"))

הרישיון

הרישיון בעמוד לא דווח בצורה מסודרת, אך מצוין שימוש ברישיון קהילתי של Llama 2 לצד אימון על נתונים מ־ShareGPT ומ־GPT. הבלבול הזה אומר שאי אפשר להכניס אותו בראש שקט למוצר מסחרי בלי בדיקה משפטית של תנאי השימוש בנתוני המקור.

הרישיון המלא בעמוד המודל ↗