GPT
L

llava-1.5-7b-hf

קוד פתוח

llava-hfllama22023-12-05

  • transformers
  • safetensors
  • llava
  • image-text-to-text
  • vision

פתרון ראייה ממוחשבת מבוסס קוד פתוח שמחבר בין תמונה לשפה, בלי להסתמך על שירותי ענן סגורים. הוא עונה על שאלות לגבי תמונות ומנתח דיאגרמות ישירות בסביבה מקומית.

  • 7.1Bפרמטרים
  • 4,096טוקנים בהקשר
  • 13.2 GBמשקל הקבצים
  • 1,983,664הורדות בחודש

מה זה

הפרויקט הזה מביא את היכולות המולטימודליות של גרסת 1.5 ישירות לתוך התשתית של transformers, ללא צורך בהתקנת מאגרים חיצוניים מסורבלים. הוא נבנה על בסיס אימון עדין של LLaMA ו־Vicuna בעזרת נתונים שנוצרו על ידי GPT, במטרה לאפשר שיחה רציפה על גבי קבצי תמונה. במקום להתעסק בהמרות משקלים עצמאיות, המודל הזה מוגדר כמשקל רשמי שנטען ישירות בקוד שלכם.

הוא מסוגל לקבל מספר תמונות במקביל בתוך אותו רצף שיחה, לזהות פריטים ספציפיים ולענות על שאלות רב ברירה לגבי תרשימים. השילוב של מודל שפה של 7.1 מיליארד פרמטרים עם מעבד תמונה מאפשר לו לחבר בין הקשר טקסטואלי לפרטים ויזואליים, בלי לחרוג מגבולות זיכרון סבירים. הוא מתאים למי שצריך תיאור תמונות או חילוץ תשובות מתרשימים פשוטים, בלי להחזיק שרתים יקרים במיוחד.

מתאים ל

  • מענה על שאלות מתרשימים

    קריאת דיאגרמות ותרשימים באנגלית ובחירת התשובה הנכונה מתוך אפשרויות נתונות.

  • תיאור תוכן תמונה

    הפקת תיאור טקסטואלי של עצמים והתרחשויות מתוך תמונות לצורכי קטלוג וחיפוש.

  • השוואה בין מספר תמונות

    העלאת מספר קבצים במקביל לקבלת ניתוח של ההבדלים ביניהם ברצף שיחה יחיד.

איפה זה נופל

המודל אומן רק על אנגלית, כך שאין מה לבנות עליו לפענוח טקסטים בעברית או לשיחה שאינה באנגלית. חלון ההקשר שלו מוגבל ל־4,096 טוקנים, מה שאומר ששרשור של כמה תמונות ברזולוציה גבוהה יחד עם שיחה ארוכה ימלא את המקום מהר מאוד. בנוסף, חילוץ פרטים קטנים מאוד מתמונות מורכבות עלול להוביל להזיות בטקסט.

שאלות
נפוצות

האם אפשר להריץ אותו בעברית?

לא. המודל הוגדר ואומן עבור השפה האנגלית בלבד. אם תפנו אליו בעברית הוא ייכשל בהבנת השאלה או יחזיר פלט משובש.

האם חייבים מעבד גרפי יקר בשביל להשתמש בו?

לא בהכרח. בעזרת כימות ל־4 ביט אפשר להריץ אותו על כרטיס מסך בסיסי או ב־Google Colab, אם כי למהירות מלאה עדיף כרטיס ייעודי של 16 גיגה.

האם הוא יודע לנתח כמה תמונות באותה פקודה?

כן. הארכיטקטורה תומכת בקבלת מספר תמונות בתוך היסטוריית השיחה, כל עוד מקפידים על תבנית ההנחיה הנכונה.

איך מריצים

כדי להריץ אותו בדיוק המקורי של float16 תצטרכו כרטיס מסך עם לפחות 16 גיגה זיכרון, שכן המשקלים לבדם תופסים 13.2 גיגה. שימוש בספריית bitsandbytes מאפשר לטעון אותו בכימות של 4 ביט, מה שמוריד את דרישות החומרה ומאפשר הרצה גם על כרטיסים צנועים יותר או על מכונות חינמיות כמו Google Colab.

אפשר להשתמש בממשק ה־pipeline הפשוט או לטעון את המודל והפרוססור ישירות. מגרסת transformers 4.48 ומעלה אפשר להעביר קישור לתמונה או נתיב מקומי ישירות לתוך תבנית הצ'אט. אם יש לכם חומרה תומכת, הפעלת Flash-Attention 2 תאיץ את מהירות הפקת התשובות בצורה מורגשת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="llava-hf/llava-1.5-7b-hf")
print(pipe("שלום"))

הרישיון

המודל כפוף לרישיון הקהילתי של Llama 2 מבית מטא. הרישיון מתיר שימוש מסחרי, אבל כולל מגבלות ספציפיות לחברות ענק עם מעל 700 מיליון משתמשים פעילים בחודש, ומחייב ייחוס מתאים בכל הפצה של שירות מבוסס המודל.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗