GPT
L

llava-onevision-qwen2-0.5b-ov-hf

קוד פתוח

llava-hfapache-2.02024-08-13

  • transformers
  • onnx
  • safetensors
  • llava_onevision
  • image-text-to-text

מודל ראייה ושפה קומפקטי שמבוסס על שילוב של מודל תמונה ו־Qwen2 קטן. הוא מתאים למי שחייב ניתוח תמונות ווידאו ישירות על חומרה חלשה ובלי תלות בענן.

  • 894Mפרמטרים
  • 13.2 GBמשקל הקבצים
  • 575,886הורדות בחודש
  • 59לייקים

מה זה

מדובר בגרסה הקטנה בסדרת OneVision, שמחברת רכיב ראייה מסוג SO400M עם מודל שפה של 0.5 מיליארד פרמטרים. המודל אומן בכמה שלבים על נתונים סינתטיים מבוססי GPT ועל תמונות וקטעי וידאו, כך שהוא מסוגל לקבל תמונה בודדת, כמה תמונות ברצף או קלט וידאו ולהחזיר תשובה טקסטואלית.

הייחוד כאן הוא הגודל. רוב מודלי הראייה דורשים כרטיסי מסך כבדים, וכאן מקבלים מודל עם פחות מ־900 מיליון פרמטרים שרץ בקלות. הוא יודע להעביר יכולות בין תמונות סטילס לווידאו, אבל בגלל גודל מודל השפה הבסיסי, יכולות ההסקה שלו מוגבלות יחסית לדגמים הגדולים בסדרה.

מתאים ל

  • קריאת שלטים ותוויות מקומית

    זיהוי ופענוח של אלמנטים ברורים מתוך תמונות על חומרה קצה חלשה.

  • מענה על שאלות מתמונות

    ביצוע משימות VQA מוגדרות וקצרות באנגלית ובסינית.

  • סיווג קטעי וידאו קצרים

    הבנת הפעולה המרכזית שמתרחשת בווידאו בעלות חישובית נמוכה.

איפה זה נופל

מודל שפה של חצי מיליארד פרמטרים מגיע עם מגבלות ברורות בהבנת שאלות מורכבות, ואי אפשר לצפות ממנו להסברים עמוקים או לוגיקה מתקדמת. הנתונים בכרטיס המודל כוללים אנגלית וסינית בלבד, כך שאין כאן תמיכה בעברית.

בנוסף, למרות שהארכיטקטורה תומכת בווידאו וברצף תמונות, איכות התשובות עלולה לרדת משמעותית בסצנות עמוסות בפרטים קטנים.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן ותועד רק עבור אנגלית וסינית. אם תפנו אליו בעברית הוא כנראה לא יבין את השאלה או יחזיר תשובות שבורות.

איזה כרטיס מסך צריך בשביל להריץ אותו?

המודל כולו שוקל פחות ממיליארד פרמטרים. כרטיס מסך צרכני פשוט עם כמה גיגה־בייט בודדים של זיכרון יספיק, ואפשר גם להריץ אותו ב־Colab חינמי או בקוונטיזציה של 4 ביט.

האם הוא מסוגל לקבל כמה תמונות בבת אחת?

כן. הארכיטקטורה נבנתה ספציפית לתמונות בודדות, רצף של כמה תמונות יחד, וסרטוני וידאו, והיא מעבירה את ההקשר ביניהם.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בגרסה 4.45 ומעלה, באמצעות pipeline פשוט או קוד טעינה ישיר. המודל מגיע בדיוק של float16 ונתמך גם להרצה בקוונטיזציה של 4 ביט דרך bitsandbytes כדי לחסוך עוד יותר זיכרון, וגם ב־Transformers.js.

בשביל להריץ אותו מספיק כרטיס מסך בסיסי עם מעט מאוד זיכרון, ואפשר אפילו להריץ אותו על מכונה חינמית של Google Colab. אם אתם צריכים רק פענוח טקסט מתמונה פשוטה בכמויות קטנות, שירות ענן יהיה זול ופשוט יותר לתחזוקה, אבל אם יש לכם צורך בעיבוד מקומי, פרטיות או וידאו רציף, שווה להריץ אותו לבד.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="llava-hf/llava-onevision-qwen2-0.5b-ov-hf")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. זה רישיון פתוח ומתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים והפצה בתוך מוצרים, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗