GPT
L

llava-v1.6-vicuna-7b

קוד פתוח

liuhaotianרישיון לא דווח2024-01-31

  • transformers
  • safetensors
  • llava
  • text-generation
  • image-text-to-text

מודל ראייה ושפה שמחבר תמונות עם טקסט על בסיס ויקוניה. הוא מתאים למי שרוצה צ'אט מולטימודלי פתוח בגודל שבעה מיליארד פרמטרים בלי לשלם על קריאות לענן.

  • 7.1Bפרמטרים
  • 4,096טוקנים בהקשר
  • 13.2 GBמשקל הקבצים
  • 63,009הורדות בחודש

מה זה

מדובר במודל שמקבל תמונה והוראה טקסטואלית ומחזיר תשובה כתובה, כשהוא בנוי על vicuna-7b-v1.5 וארכיטקטורת LlavaLlamaForCausalLM. את האימון עשו על שילוב של חצי מיליון זוגות תמונה וטקסט מפולטרים, לצד דאטהסטים של מענה על שאלות חזותיות ודוגמאות שנוצרו מול מודלים סגורים כמו GPT-4V.

הוא מיועד בעיקר למי שחוקר מודלים מולטימודליים או רוצה בוט שיודע לדבר על תמונות ברמת הבנה בסיסית עד בינונית. בניגוד למודלי טקסט טהורים מאותה תקופה, השילוב של חלקי הראייה מאפשר לו לעקוב אחרי הוראות סביב קבצים גרפיים, אבל צריך לזכור שהוא מוגבל לחלון הקשר קצר יחסית של 4,096 טוקנים.

מתאים ל

  • מחקר על מודלי ראייה

    הכרטיס מייעד אותו במפורש לניסויים של חוקרים בתחומי הראייה הממוחשבת והשפה.

  • בוט מקומי להבנת תמונות

    מתאים למי שרוצה לשאול שאלות על תמונות על גבי חומרה מקומית בלי תלות ברשת.

  • מענה על שאלות חזותיות

    הוא אומן על מאות אלפי דוגמאות של VQA ומיועד לחלץ מידע מתוך קובץ גרפי.

איפה זה נופל

היוצרים מגדירים את השימוש העיקרי למחקר וחובבים בלבד, מה שאומר שלא בדקו אותו לעומק ככלי למוצר יציב. האימון נשען בחלקו על דאטה סינתטי שנוצר על ידי מודלים אחרים, מה שעלול לייצר הזיות על פרטים קטנים בתמונות. בנוסף, אין בכרטיס שום נתון על תמיכה בשפות שאינן אנגלית, אז אל תבנו עליו לפענוח תמונות עם טקסט בעברית.

אותה משפחה

llava-v1.6-vicuna יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להשתמש במודל הזה בעברית?

הכרטיס מציג דאטהסטים באנגלית בלבד ולא מציין תמיכה בעברית. סביר להניח שהוא יתקשה מאוד להבין שאלות בעברית או לזהות טקסט מקומי שמופיע בתוך התמונה.

האם המודל מתאים לשימוש מסחרי במוצר?

בגלל ששדה הרישיון ריק והטקסט מזכיר רק את רישיון הבסיס של Llama 2, אי אפשר לדעת בוודאות. מפתחים שמחפשים מודל לפרודקשן צריכים להיזהר מחשיפה משפטית עד לבירור מול היוצרים.

איך מריצים

המשקלים שוקלים 13.2 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 16 גיגה זיכרון כדי לטעון אותו כמו שהוא דרך ספריית transformers. אם תבצעו קוונטיזציה לארבעה ביט תוכלו לדחוף אותו גם לכרטיסים ביתיים עם 8 או 12 גיגה זיכרון.

אם אתם צריכים רק מענה מזדמן לכמה תמונות ביום ולא רוצים לתחזק שרת או לשלם על כרטיס ייעודי בענן שרץ כל הזמן, פשוט תשתמשו ב־API מסחרי. החזקה של מכונה כזו בענן מתחילה לעלות עשרות דולרים בחודש ומשתלמת רק אם יש לכם תעבורה קבועה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="liuhaotian/llava-v1.6-vicuna-7b")
print(pipe("שלום"))

הרישיון

הרישיון של המודל עצמו לא דווח בעמוד, אבל כרטיס המודל מזכיר את הרישיון של Llama 2 עליו מבוססת ויקוניה. מצב כזה מייצר אי ודאות משפטית מוחלטת, ולכן לא הייתי משלב אותו בקוד של מוצר מסחרי סגור לפני שבודקים את תנאי המקור בגיטהאב של הפרויקט.

הרישיון המלא בעמוד המודל ↗