GPT
L

llava-interleave-qwen-0.5b-hf

קוד פתוח

llava-hfother2024-07-10

  • transformers
  • onnx
  • safetensors
  • llava
  • image-text-to-text

מודל ראייה ושפה קומפקטי שמסוגל לעבד רצף של כמה תמונות יחד. הוא מתאים למי שמחפש מודל קל למחקר או ניסויים בלי להחזיק שרת כבד.

  • 864Mפרמטרים
  • 32,768טוקנים בהקשר
  • 13.2 GBמשקל הקבצים
  • 38,570הורדות בחודש

מה זה

מדובר במודל מולטימודלי המבוסס על שילוב בין רכיב ראייה לשפת הבסיס של Qwen1.5 בגרסת 0.5B, עם 864 מיליון פרמטרים בסך הכל. השוני העיקרי שלו מול מודלים זעירים אחרים הוא היכולת לעבוד עם תמונות שזורות בטקסט, מה שמאפשר לו לקבל מספר תמונות בפנייה אחת, להשוות ביניהן או לנתח פריימים מתוך סרטון וידאו.

הוא מתוכנן לקבל שיחה שמשלבת תמונות וטקסט ומחזיר תשובות באנגלית. חלון ההקשר שלו מגיע ל־32,768 טוקנים, כך שאפשר להזין לו כמות יפה של תמונות ברצף אחד, כל עוד מדובר במשימות הבנה בסיסיות של סצנות, קריאת תרשימים או השוואה ויזואלית פשוטה.

מתאים ל

  • השוואת תמונות

    זיהוי שינויים או הבדלים בין שתי תמונות ברצף אחד בזכות התמיכה בריבוי תמונות.

  • ניתוח פריימים מווידאו

    דגימת כמה תמונות מתוך סרטון והזנתן למודל יחד כדי לתאר מה קורה ברצף.

  • פענוח תרשימים פשוטים

    מענה על שאלות אמריקאיות קצרות על בסיס דיאגרמות או תוויות באנגלית.

איפה זה נופל

החיסרון המרכזי כאן הוא גודל מודל השפה. עם 864 מיליון פרמטרים בלבד, יכולת ההסקה מוגבלת מאוד לעומת מודלים גדולים, והוא נוטה לטעויות בהבנת הנחיות מורכבות או בניתוח פרטים קטנים בתמונה. בנוסף, המודל מיועד ומאומן רשמית באנגלית בלבד, כך שלא כדאי לבנות עליו לפענוח טקסט בעברית מתוך מסמכים או תמונות.

שאלות
נפוצות

האם אפשר להשתמש במודל לפרויקט מסחרי?

לא. כרטיס המודל מגדיר אותו למחקר בלבד ואוסר במפורש שימוש מסחרי, כך שהוא מתאים לניסויים אישיים או אקדמיים בלבד.

האם המודל עובד בעברית?

לא באופן רשמי. המודל אומן לשפה האנגלית, ולכן שאלות בעברית או ניסיון לקרוא טקסט עברי מתמונה יניבו תוצאות לא יציבות.

איך מריצים

בפועל מריצים אותו ישירות דרך ספריית transformers בפייתון באמצעות פונקציית pipeline או טעינה רגילה עם תמיכה בפורמט bfloat16 או float16. כדי לחסוך זיכרון אפשר להשתמש בקוונטיזציה של 4 ביט דרך bitsandbytes או להאיץ עם Flash-Attention 2. למרות שמשקל הקבצים להורדה מגיע ל־13.2 ג'יגה־בייט בגלל צורת האריזה, המודל עצמו זעיר ויכול לרוץ בקלות על כרטיס מסך ביתי בסיסי עם CUDA.

אם אין לכם כרטיס מסך ייעודי בכלל ותרצו לעבד כמויות גדולות של תמונות בזמן אמת, עדיף להשתמש ב־API חיצוני של ספק ענן במקום להסתבך עם התקנות מקומיות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="llava-hf/llava-interleave-qwen-0.5b-hf")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כחריג ואוסר במפורש כל שימוש מסחרי. המפתחים מציינים שמדובר בפרויקט מחקרי בלבד, הכפוף לתנאי השימוש של מערכי הנתונים ומודלי הבסיס כמו Qwen, ולכן אי אפשר לשלב אותו במוצר שמייצר הכנסות.

הרישיון המלא בעמוד המודל ↗