GPT
L

llama3-llava-next-8b-hf

קוד פתוח

llava-hfllama32024-07-19

  • transformers
  • safetensors
  • llava_next
  • image-text-to-text
  • vision

המודל מחבר את מנוע השפה של לאמה 3 עם יכולות ראייה ממוחשבת. הוא מיועד למי שמחפש צ'אט מולטימודלי ומענה על שאלות מתמונות בגודל של שמונה מיליארד פרמטרים.

  • 8.4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.6 GBמשקל הקבצים
  • 24,310הורדות בחודש

מה זה

מדובר בגרסת NeXT שמחברת בין אנקודר ראייה למודל הבסיס Meta Llama 3 8B Instruct. המטרה כאן היא לתת יכולת ניתוח תמונה בלי לאבד את יכולות השיחה החזקות של לאמה 3, כשהאימון עצמו כלל תערובת רחבה יותר של נתונים ביחס לגרסה אחת נקודה שש.

ערכת האימון כללה מעל חצי מיליון זוגות תמונה וטקסט מפולטרים, לצד מאות אלפי דוגמאות של מענה על שאלות אקדמיות מתמונות ונתונים שנוצרו על ידי מודלים מסחריים כמו GPT-4V. בפועל זה מאפשר לו להתמודד יפה עם פענוח דיאגרמות, זיהוי שלטים ומענה ישיר לשאלות על תוכן ויזואלי.

מתאים ל

  • מענה על שאלות מדיאגרמות

    הוא אומן על מאות אלפי שאלות ויזואליות ויודע לחלץ תשובות מתוך שרטוטים ותרשימים.

  • תיאור תמונות לאפליקציות

    השילוב עם לאמה 3 נותן ניסוח טבעי ומפורט למה שמופיע בתמונה.

  • בוט שיחה רב־תחומי

    מתאים לממשקי צ'אט שמקבלים גם קלט טקסטואלי וגם תמונות כחלק מההקשר.

איפה זה נופל

המודל הוגדר רשמית רק עבור השפה האנגלית, ולכן לא הייתי בונה עליו לפענוח טקסט בעברית מתוך תמונות או לשיחות מקומיות. חלון ההקשר מוגבל ל־8,192 טוקנים, מה שחוסם תהליכים שדורשים שליחה של הרבה תמונות ברצף או היסטוריית שיחה עמוסה.

בנוסף, חלק משמעותי מנתוני האימון הגיע מתיוג אוטומטי ומודלים מסחריים, מה שמחייב לבדוק היטב הזיות וטעויות זיהוי בפרטים קטנים לפני שמשלבים אותו במערכת אמיתית.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל מתועד ומוגדר לשפה האנגלית בלבד. יכול להיות שהוא יבין מילים בסיסיות בגלל לאמה 3, אבל הוא לא אומן על עברית ולא הייתי מסתמך עליו למשימות כאלה.

כמה זיכרון וידאו צריך כדי להריץ אותו מקומית?

בדיוק מלא של float16 תצטרכו כרטיס עם לפחות 20 גיגה זיכרון כדי לטעון 15.6 גיגה בייט של משקלים. אם תפעילו טעינה ב־4 ביט דרך bitsandbytes, תוכלו להריץ אותו גם על כרטיסים צנועים יותר של 10 עד 12 גיגה.

איך מריצים

המשקל המלא של הקבצים מגיע ל־15.6 גיגה בייט בפורמט float16, כך שתצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון כדי להריץ אותו ישירות דרך ספריית transformers. כדי להאיץ את הביצועים אפשר להפעיל Flash-Attention 2.

אם אין לכם כרטיס חזק, אפשר להשתמש בקוונטיזציה של 4 ביט דרך ספריית bitsandbytes ולחסוך המון זיכרון GPU. תהליך הטעינה נתמך ישירות ב־pipeline הרגיל של Hugging Face כולל טיפול בתמונות דרך chat template.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="llava-hf/llama3-llava-next-8b-hf")
print(pipe("שלום"))

הרישיון

הרישיון של המודל הוא רישיון llama3 של חברת מטא. הרישיון מאפשר שימוש מסחרי ומחקר, אך כפוף למדיניות השימוש המקובלת וההגבלות של מטא, כולל מגבלות על היקף משתמשים חודשי חריג ותנאי הפצה למוצרי קצה.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗