GPT
L

llava-onevision-qwen2-7b-ov-hf

קוד פתוח

llava-hfapache-2.02024-08-13

  • transformers
  • safetensors
  • llava_onevision
  • image-text-to-text
  • vision

הוא משלב את Qwen2 בגרסת שמונה מיליארד פרמטרים ומעבד תמונות ווידאו. זה פתרון חזק למי שחייב מודל ראייה מקומי שיודע להתמודד עם כמה תמונות ברצף.

  • 8Bפרמטרים
  • 15.0 GBמשקל הקבצים
  • 52,590הורדות בחודש
  • 39לייקים

מה זה

מדובר בשילוב של מודל השפה Qwen2 יחד עם מקודד ראייה מסוג SO400M, שעבר אימון בכמה שלבים על מיליוני דוגמאות טקסט ותמונה סינתטיות. המטרה כאן היא לקחת משימות ראייה שונות ולאחד אותן תחת מודל פתוח אחד שלא קורס כשמבקשים ממנו לעבור מניתוח תמונה בודדת לעבודה עם כמה תמונות או קטעי וידאו.

בניגוד לגרסאות מוקדמות שהתמקדו בעיקר בזיהוי עצמים בתמונה אחת מבודדת, הארכיטקטורה הנוכחית מעבירה ידע בין תרחישים שונים. זה מאפשר לו להבין מה קורה בציר זמן של וידאו או להשוות בין מספר תמונות שהמשתמש מעביר באותה שיחה, בלי צורך במודל ייעודי נפרד לכל משימה.

מתאים ל

  • השוואה בין תמונות

    ניתוח של כמה מסמכים או תמונות מוצר באותה שאילתה לצורך בדיקת הבדלים.

  • ניתוח תוכן מתוך וידאו

    מענה על שאלות לגבי רצף פעולות או אירועים שמתרחשים בקובץ וידאו.

  • חילוץ מידע מתרשימים באנגלית

    הבנת דיאגרמות, גרפים מדעיים ותמונות טכניות שמלוות בטקסט באנגלית.

איפה זה נופל

האימון נעשה כולו באנגלית ובסינית, כך שאין כאן תמיכה מובנית בעברית. אם תשלחו לו תמונות עם טקסט בעברית או תשאלו שאלות בעברית, הוא צפוי לפספס או להמציא תשובות. בנוסף, עיבוד של וידאו או מספר רב של תמונות ברזולוציה גבוהה מעמיס מאוד על הזיכרון, ומחייב בדיקה קפדנית של זמני הריצה לפני שמשלבים אותו בזמן אמת.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב מקומי רגיל?

במשקל המלא צריך כרטיס מסך ייעודי של 24 גיגה. בשימוש בקוונטיזציה של 4 ביט אפשר להסתפק בחומרה צנועה יותר עם שמונה עד עשרה גיגה זיכרון גרפי.

האם הוא מתאים לזיהוי טקסט עברי מתמונות?

לא. המודל אומן על אנגלית וסינית בלבד, ולכן הוא לא יזהה כיתוב בעברית בצורה אמינה ולא מתאים למשימות כאלה בארץ.

איך מריצים

כדי להריץ אותו בפורמט המקורי של 16 ביט תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון גרפי, בהתחשב בכך שקבצי המשקלים תופסים כמעט 15 גיגה נטו על הדיסק. אם המשאבים מוגבלים, אפשר לכווץ אותו ל־4 ביט בעזרת ספריית bitsandbytes, מה שמאפשר להריץ אותו אפילו על כרטיס מסך בסיסי או בגרסה החינמית של גוגל קולאב.

ההרצה מתבצעת ישירות בספריית transformers החל מגרסה 4.45 ומעלה, וניתן להשתמש ב־Flash Attention 2 כדי לקצר זמני תגובה. אם אין לכם שרת עם מעבד גרפי מתאים וזמין ברציפות, קריאה לשירות חיצוני תהיה פשוטה וזולה יותר מתחזוקת תשתית כזו.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="llava-hf/llava-onevision-qwen2-7b-ov-hf")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצר. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗