GPT
L

llava-v1.6-34b

קוד פתוח

liuhaotianapache-2.02024-01-31

  • LLaVA
  • safetensors
  • llava
  • image-text-to-text
  • conversational

מודל ראייה ושפה פתוח שנשען על בסיס חזק ומנתח תמונות לצד טקסט. הוא מתאים למי שרוצה צ'אטבוט מולטימודלי עצמאי בלי לשלוח תמונות לשירות חיצוני.

  • 35Bפרמטרים
  • 4,096טוקנים בהקשר
  • 64.7 GBמשקל הקבצים
  • 42,643הורדות בחודש

מה זה

מדובר במודל שמחבר יכולות ראייה ממוחשבת עם מודל השפה Nous-Hermes-2-Yi-34B. הוא אומן בדצמבר 2023 על שילוב של מיליוני דוגמאות שכוללות צמדי תמונה וטקסט, שיחות מפרויקטים כמו ShareGPT, ומידע סינתטי שנבנה בעזרת GPT-4V. המטרה כאן היא לייצר צ'אטבוט שמבין הוראות מורכבות על גבי תמונות ולא רק פולט תיאור יבש של מה שרואים.

הבסיס של 34,751,166,464 פרמטרים נותן לו יתרון בהבנת הקשר ובהפקת טקסט רציף לעומת מודלים קטנים יותר בסדרה. הוא נבדק מול 12 מבחני ביצועים שונים, חלקם משימות שאלות ותשובות אקדמיות על תמונות וחלקם מדדים מודרניים למעקב אחרי הוראות מולטימודליות.

מתאים ל

  • מענה על שאלות מתמונות

    ניתוח תרשימים וצילומים הודות לשילוב נתוני VQA ואימון ייעודי על הבנת שאלות סביב תמונה.

  • צ'אטבוט מולטימודלי מקומי

    שיחה חופשית על מסמכים גרפיים ותמונות בתוך רשת פנימית בלי להוציא מידע החוצה.

  • מחקר בתחום הראייה והשפה

    בדיקת יכולות מעקב אחרי הוראות מורכבות על בסיס מודל פתוח בעל 35B פרמטרים.

איפה זה נופל

חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, מה שמקשה על שיחות ארוכות שכוללות גם מידע מתמונות קודמות וגם טקסט מורכב. בנוסף, הכרטיס מציין שהיעוד המרכזי שלו הוא מחקר וניסויים של חובבים ולא שירות פרודקשן יציב. האימון נשען בחלקו על נתונים שנוצרו על ידי מודלים אחרים, מה שיכול לגרור טעויות בהסבר פרטים קטנים בתמונה או הזיות במענה לשאלות עובדתיות.

אותה משפחה

llava יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה זיכרון וידאו דרוש להרצה שלו בלי שינויים?

המשקלים לבדם תופסים 64.7 GB בפורמט המקורי. תצטרכו חומרה עם לפחות 70GB עד 80GB של זיכרון גרפי כדי לטעון אותו ולהשאיר מקום להקשר של 4,096 טוקנים.

האם המודל מיועד למערכות ייצור מבצעיות?

כרטיס המודל מגדיר את השימוש העיקרי למחקר של אנשי אקדמיה וחובבים. הוא אינו מוגדר כמערכת מוכנה לייצור ודורש בדיקות עצמאיות שלכם לפני שילוב במערכת פעילה.

איך מריצים

כדי להריץ אותו אצלכם תצטרכו להתמודד עם קבצים במשקל 64.7 GB בפורמט bfloat16 שמחולקים ל־23 קבצים. זה אומר שחובה להחזיק כרטיס גרפי עם זיכרון וידאו גדול מאוד, או לחלק את 60 השכבות שלו על פני כמה כרטיסים, אחרת תצטרכו להשתמש בכימות של המשקלים.

אם אין לכם שרת ייעודי זמין עם מספיק זיכרון, ההרמה המקומית תהיה איטית ויקרה מדי לחומרה ביתית רגילה. במצב כזה עדיף לצרוך אותו דרך תשתית ענן שכבר מחזיקה מופע מוכן במקום לתחזק את הברזלים לבד.

pip install -U huggingface_hub
hf download liuhaotian/llava-v1.6-34b

הרישיון

הרישיון המדווח בעמוד הוא apache-2.0, שמאפשר שימוש חופשי וגם שימוש מסחרי, אבל כרטיס המודל מפנה במפורש לתנאי הרישיון של מודל הבסיס Nous-Hermes-2-Yi-34B. לפני שמשלבים אותו במוצר מסחרי, חובה לבדוק את תנאי השימוש של מודל הבסיס כדי לוודא שאין שם הגבלות נוספות על הפצה או שימוש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗