GPT
T

tiny-llava-v1-hf

קוד פתוח

bczhouapache-2.02024-01-11

  • transformers
  • safetensors
  • llava
  • image-text-to-text
  • vision-language

מודל ראייה ושפה קטן של 1.4 מיליארד פרמטרים שרץ ישירות דרך transformers. הוא נותן מענה מהיר להבנת תמונות על חומרה מקומית צנועה.

  • 1.4Bפרמטרים
  • 5.3 GBמשקל הקבצים
  • 1,245הורדות בחודש
  • 57לייקים

מה זה

המודל מחבר בין עיבוד תמונה למודל שפה קטן כדי לענות על שאלות לגבי קבצי תמונה. הוא פורסם בינואר 2024 כגרסה הראשונה בפרויקט TinyLLaVA, שמנסה לקחת את היכולות של LLaVA ולדחוס אותן לממדים מינימליים.

היוצרים עצמם מגדירים אותו כרכיב ישן ברשימת הדגמים שלהם, ובמבחנים שהם מציגים, הדורות המאוחרים יותר של הפרויקט, כמו גרסת ה־3.1B שמבוססת על Phi-2, עוקפים אותו ומציגים תוצאות גבוהות יותר במבחני ראייה כמו VQA ו־LLaVA-Bench. המודל הזה מיועד בעיקר למי שחייב לשמור על משקל מינימלי וצריכת זיכרון נמוכה, או כבסיס קל משקל לבדיקות ראשוניות של שילוב תמונה וטקסט בלי להרים תשתית כבדה.

מתאים ל

  • זיהוי עצמים פשוט

    מענה מהיר על שאלות לגבי פריטים בולטים בתמונה, בזכות משקל קל שמאפשר ריצה מקומית על כרטיסי מסך קטנים.

  • פיתוח אבטיפוס מהיר

    בדיקת ממשקי ראייה ממוחשבת בתוך קוד פייתון בעזרת transformers סטנדרטי וללא צורך בהקמת שרתי ענק.

  • סיווג תמונות מונחה שאלות

    חילוץ תשובות קצרות מקבצי תמונה בתהליכים אוטומטיים שדורשים עלות חומרה אפסית.

איפה זה נופל

בגלל גודל של 1.4B בלבד, יכולת ההסקה מוגבלת מאוד לעומת מודלי ראייה גדולים, והוא נוטה לפספס פרטים עדינים בתמונות צפופות. החומר מתעד תמיכה באנגלית ובסינית בלבד, כך שעברית לא נתמכת כאן באופן רשמי ולא הייתי מסתמך עליו לפענוח טקסטים מקומיים. בנוסף, חובה להיצמד למבנה הפרומפט המדויק עם תגית התמונה הייעודית, אחרת התוצאות משתבשות לחלוטין.

שאלות
נפוצות

האם כדאי לבחור בו לפרויקט חדש?

היוצרים עצמם מגדירים אותו כמודל ישן ומציעים גרסאות חדשות יותר כמו 1.5B, 2.0B ו־3.1B. אלא אם אתם צריכים בדיוק את המשקלים האלה, הגרסאות המאוחרות יותר עדיפות ומציגות ציונים טובים יותר במבחנים.

האם המודל מבין הוראות בעברית?

התיעוד הרשמי מציין תמיכה באנגלית ובסינית בלבד. הוא לא אומן על עברית, ולכן ניסיון לתשאל אותו בעברית עלול להוביל לטעויות קשות או להזיות.

האם ניתן להריץ אותו דרך llama.cpp?

רשימת המשימות של הפרויקט מראה שתמיכה ב־Ollama וב־llama.cpp סומנה כמשימה פתוחה שטרם הושלמה. נכון לתיעוד הקיים, ההרצה מתבצעת בעיקר דרך ספריית transformers בפייתון.

איך מריצים

אתם יכולים לטעון אותו בקלות בעזרת ספריית transformers הרגילה, דרך פייפליין סטנדרטי של תמונה לטקסט או באמצעות LlavaForConditionalGeneration. הקבצים שוקלים 5.3 גיגהבייט בדיוק מלא, אבל הרצה ב־float16 מקצצת את תפיסת הזיכרון ומאפשרת להריץ אותו על כרטיס מסך בסיסי עם 6 עד 8 גיגהבייט VRAM.

אם אתם צריכים רק תיוג מהיר או בדיקת היתכנות מקומית על לפטופ, ההרצה העצמית פשוטה מאוד. לעומת זאת, אם הדרישה היא ניתוח תמונות מורכב שדורש הבנה עמוקה של טקסטים זעירים בתוך תמונה, ביצועים של מודלים גדולים דרך ענן יתנו תוצאה מדויקת בהרבה בלי להתעסק עם שרתים מקומיים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="bczhou/tiny-llava-v1-hf")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש. אתם יכולים לשלב אותו במוצרים פנימיים או מסחריים, בתנאי שאתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗