GPT
L

llava-v1.6-mistral-7b-hf

קוד פתוח

llava-hfapache-2.02024-02-20

  • transformers
  • safetensors
  • llava_next
  • image-text-to-text
  • vision

שילוב בין מפענח תמונה לבין Mistral-7B שמאפשר ניתוח תמונות והסקת מסקנות. הוא מתאים למי שצריך ראייה ממוחשבת בקוד פתוח עם רישיון מסחרי נוח.

  • 7.6Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.1 GBמשקל הקבצים
  • 527,463הורדות בחודש

מה זה

המודל מחבר בין רשת ראייה למודל השפה Mistral-7B-Instruct-v0.2 כדי לעבד תמונות לצד טקסט. בגרסה הזו הוסיפו תמיכה ברזולוציית תמונה דינמית גבוהה יותר ואימנו אותו על דאטה רחב של הוראות ויזואליות. השינויים האלה נועדו לשפר את היכולת שלו לקרוא טקסט מתוך תמונות ולבצע הסקת מסקנות על בסיס ידע כללי בהשוואה לגרסה הקודמת בסדרה.

ההבדל המרכזי מול ארכיטקטורות קודמות של LLaVA הוא הבחירה במודל בסיס שמשוחרר תחת אפאצ'י במקום מודלים עם מגבלות שימוש, יחד עם חלון הקשר של 32,768 טוקנים. זה מאפשר להזין שיחות ארוכות או כמה תמונות ברצף בלי לחנוק את הזיכרון הלשוני מיד בהתחלה.

מתאים ל

  • חילוץ טקסט מתרשימים

    הרזולוציה הדינמית עוזרת לו לקרוא תוויות קטנות ולהבין קשרים ותרשימים באנגלית.

  • בוט שיחה מבוסס תמונות

    הבסיס של Mistral עם חלון של 32k טוקנים מאפשר לנהל דיון מתמשך על פרטים בתמונה.

  • תיוג תוכן ויזואלי

    הוא מזהה עצמים והקשרים בסיסיים כדי לייצר תיאורים מילוליים לתמונות באתרי תוכן.

איפה זה נופל

המודל אומן על אנגלית בלבד ולא מיועד לעברית. אם תנסו לחלץ ממנו שלטים בעברית או תשאלו אותו על מסמך מקומי הוא כנראה יזייף. בנוסף, מפתחי המודל המקוריים אפילו לא כתבו לו כרטיס מודל מסודר והצוות של Hugging Face נאלץ להשלים את המידע בעצמו, מה שאומר שאין בדיקות ביצועים מפורטות או פירוט על נקודות כשל ספציפיות בדוקומנטציה.

שאלות
נפוצות

האם המודל יודע לקרוא עברית מתוך תמונה?

לא. המודל הוגדר ואומן לשפה האנגלית בלבד. ניתוח של מסמכים, תפריטים או תמונות עם טקסט בעברית צפוי לייצר שגיאות והזיות.

האם אפשר להריץ אותו על כרטיס מסך ביתי?

במשקל מלא של 14.1 גיגה בייט צריך כרטיס עם 16 גיגה זיכרון לפחות. אם מפעילים קוונטיזציה של 4 ביט עם bitsandbytes, אפשר להריץ אותו גם על כרטיסים נגישים יותר עם 8 עד 12 גיגה זיכרון.

איך מריצים

במשקל של 14.1 גיגה בייט ובדיוק float16 תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון כדי לטעון אותו ישירות. הקוד נתמך בספריית transformers הרגילה ואפשר להריץ אותו דרך pipeline פשוט או בטעינה ישירה של הארכיטקטורה.

אם אין לכם כרטיס חזק, אפשר להשתמש בקוונטיזציה של 4 ביט דרך bitsandbytes או להפעיל Flash-Attention 2 כדי לחסוך מקום ולהאיץ ביצועים. למי שאין שרת ייעודי או שסתם בודק התכנות, שירות ענן או API מוכן יחסוך את כאב הראש של הקצאת חומרה יקרה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="llava-hf/llava-v1.6-mistral-7b-hf")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעת הרישיון המקורית ומציינים שינויים אם נעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗