GPT
S

SmolVLM2-2.2B-Instruct

קוד פתוח

HuggingFaceTBapache-2.02025-02-08

  • transformers
  • safetensors
  • smolvlm
  • image-text-to-text
  • video-text-to-text

מודל מולטימודלי קומפקטי שמנתח וידאו, תמונות וטקסט עם דרישות זיכרון נמוכות. הוא מתאים למי שרוצה עיבוד מקומי של מדיה בלי להחזיק שרת כבד.

  • 2.2Bפרמטרים
  • 8,192טוקנים בהקשר
  • 8.4 GBמשקל הקבצים
  • 127,774הורדות בחודש

מה זה

המודל הזה משלב מקודד תמונה SigLIP עם מפענח SmolLM2 כדי לעבד קלט מעורב של וידאו, תמונות מרובות וטקסט, ולהחזיר תשובות טקסטואליות. הוא מאפשר לשאול שאלות על מדיה, להשוות בין פריימים ולחלץ כיתובים, אבל אינו מייצר תמונות או סרטונים כלל.

בבנצ'מרקים של ראייה ווידאו הוא מציג תוצאות מעשיות לגודלו. במבחן OCRBench הוא מקבל 72.9 ובבדיקת מסמכים DocVQA הוא מגיע ל־79.98, מה שמראה יכולת טובה בקריאת טקסט מתוך תמונה. במבחני וידאו כמו Video-MME הוא מגיע ל־52.1, תוצאה גבוהה משמעותית מאחיו הקטנים בסדרה, אם כי עדיין יש לו פערים בניתוח מורכב ביחס למודלי ענק.

מתאים ל

  • ניתוח סרטוני וידאו

    צורך רק 5.2GB ב־GPU ומנתח תוכן וידאו ישירות על מכשיר מקומי.

  • חילוץ טקסט ממסמכים

    תוצאה של 79.98 במבחן DocVQA מאפשרת מענה מדויק על שאלות מטפסים.

  • השוואה בין תמונות

    תומך בערבוב של מספר תמונות וטקסט באותו רצף לצורך ניתוח הבדלים.

איפה זה נופל

המודל מוגדר רשמית כלא מתאים לתרחישים בעלי סיכון גבוה או להחלטות קריטיות שמשפיעות על בני אדם, כמו גיוס, חינוך או מתן אשראי. הוא עלול לייצר מידע שנשמע מדויק ועובדתי אך שגוי לחלוטין. בנוסף, הוא תומך באופן מוצהר באנגלית בלבד, ואין להסתמך עליו בעיבוד טקסט בעברית ללא בדיקה יסודית. במבחני הבנה מתקדמים כמו MMStar הוא עומד על 46 בלבד, מה שמעיד על קושי בהסקה לוגית עמוקה מתוך תמונות.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

כרטיס המודל מגדיר אנגלית בלבד כשפה נתמכת. המודל אומן בעיקר על דאטה באנגלית, ולכן לא הייתי בונה עליו לחילוץ טקסט או הבנת תמונות עם עברית במוצר אמיתי בלי אימון ייעודי.

איזו חומרה בדיוק צריך כדי להריץ סרטונים?

עבור הסקת וידאו דרוש כרטיס מסך עם לפחות 5.2GB של זיכרון GPU, לצד התקנת decord וספריית transformers. כרטיס גרפי מודרני בסיסי יספיק לעבודה רציפה.

איך מריצים

טוענים את המודל דרך ספריית transformers בפייתון באמצעות AutoModelForImageTextToText. כדי להריץ וידאו צריך להתקין בנוסף את חבילת decord, ומומלץ להשתמש ב־flash-attn ובדיוק bfloat16. להרצת וידאו הוא צורך 5.2GB של זיכרון כרטיס מסך בלבד, כך שאפשר להריץ אותו בקלות על כרטיס גרפי ביתי פשוט.

אם אתם צריכים רק תיוג מדיה נקודתי בלי דרישות פרטיות, שירותי ענן מסחריים חוסכים את הצורך בהרצה מקומית. הפעלת המודל בעצמכם משתלמת במיוחד כשיש עיבוד מקומי רציף על מכשירי קצה או רצון להימנע מעלויות ענן שוטפות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="HuggingFaceTB/SmolVLM2-2.2B-Instruct")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי קוד והפצה של המודל בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובת פתיחת הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗