GPT
L

llava-v1.6-mistral-7b

קוד פתוח

liuhaotianapache-2.02024-01-31

  • transformers
  • safetensors
  • llava_mistral
  • text-generation
  • image-text-to-text

מודל מולטימודלי שמחבר ראייה ממוחשבת לבסיס החזק של מיסטרל. הוא מיועד למי שמחפש צ'אט מבוסס תמונה וטקסט בלי להסתמך על שירותים סגורים.

  • 7.6Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.1 GBמשקל הקבצים
  • 62,035הורדות בחודש

מה זה

המודל הזה לוקח את Mistral-7B-Instruct-v0.2 ומאמן אותו להבין תמונות יחד עם הוראות טקסטואליות. הוא פועל כמודל שפה אוטורגרסיבי רגיל, אבל מקבל כקלט גם תמונות וגם טקסט, ומחזיר תשובות מפורטות על מה שמוצג לפניו. אימנו אותו על שילוב רחב של מאות אלפי דוגמאות מפולטרות, שאלות ותשובות אקדמיות מבוססות ראייה, ודאטה שנוצר בעזרת GPT-4V.

ההבדל המשמעותי לעומת מודלים פשוטים יותר בגודל 7B הוא חלון הקשר של 32,768 טוקנים יחד עם הבסיס המוכח של מיסטרל. זה אומר שאפשר להזין לו שיחות ארוכות או כמה תמונות והוראות מורכבות בלי לחנוק את הזיכרון שלו מיד. הוא נבדק מול תריסר מבחני ביצועים שונים של מענה על שאלות חזותיות ומילוי הוראות.

מתאים ל

  • מענה על שאלות מתמונה

    ניתוח תוכן של תמונה בודדת וקבלת תשובות ישירות על אלמנטים שמופיעים בה.

  • חילוץ תיאורים מפורטים

    יצירת כיתובים עשירים ומדויקים לתמונות עבור חיפוש או קטלוג פנימי.

  • מחקר וניסוי מקומי

    בדיקת יכולות מולטימודליות על גבי חומרה עצמאית בלי תלות בספקים חיצוניים.

איפה זה נופל

היוצרים עצמם מייעדים אותו בעיקר למחקר ולחובבים, ולא בהכרח למערכות ייצור תובעניות. חלק גדול מהאימון שלו נשען על נתונים סינתטיים שנוצרו על ידי מודלים אחרים, מה שעלול להוביל להזיות בפרטים קטנים או בטקסט שמופיע בתוך תמונות. חייבים לבדוק אותו היטב על המשימה הספציפית שלכם לפני שמסתמכים על התשובות שלו בעיוורון.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות מקוד פייתון פשוט?

כן, המודל נתמך ישירות בספריית transformers של Hugging Face. כל מה שצריך זה לייבא את הארכיטקטורה המתאימה, לטעון את המשקלים ב־bfloat16 ולהעביר לו תמונה יחד עם הטקסט.

האם המודל מתאים לעיבוד מסמכים ארוכים עם תמונות?

חלון ההקשר תומך בעד 32,768 טוקנים, שזה די והותר לשיחות ארוכות או למספר פניות ברצף. עם זאת, רמת הדיוק בפרטים זעירים עדיין תלויה ברזולוציה ובאופי הדאטה שהוא אומן עליו.

איך מריצים

במשקל של 14.1 גיגה בייט ובדיוק bfloat16, המודל דורש כרטיס מסך עם לפחות 16 עד 24 גיגה בייט של זיכרון כדי לטעון אותו ולעבד תמונות בלי קריסות. הוא רץ ישירות דרך ספריית transformers הרגילה בפייתון, כך שאין צורך בכלים מיוחדים כדי להתחיל לעבוד איתו מקומית.

אם יש לכם כרטיס ביתי חלש יותר, תצטרכו להשתמש בקוונטיזציה או לפנות לפתרונות ענן. כשאין תשתית GPU זמינה או כשהעומס נמוך ומזדמן, קריאה לשרת מרוחק עדיפה על פני החזקת שרת ייעודי שדולק סתם.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="liuhaotian/llava-v1.6-mistral-7b")
print(pipe("שלום"))

הרישיון

המודל מדווח תחת רישיון apache-2.0, אבל כרטיס המודל מפנה גם לרישיון של מודל הבסיס Mistral-7B-Instruct-v0.2. ברישיון אפאצ'י מותר להשתמש בקוד ובמשקלים לצרכים מסחריים ופרטיים, לשנות אותם ולהפיץ הלאה, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗