GPT
S

SmolVLM2-256M-Video-Instruct

קוד פתוח

HuggingFaceTBapache-2.02025-02-11

  • transformers
  • onnx
  • safetensors
  • smolvlm
  • image-text-to-text

מודל ראייה ושפה קומפקטי שמנתח וידאו ותמונות ישירות על החומרה המקומית. הוא דורש פחות מגיגה וחצי של זיכרון כרטיס מסך בהרצה.

  • 256Mפרמטרים
  • 8,192טוקנים בהקשר
  • 3.8 GBמשקל הקבצים
  • 55,846הורדות בחודש

מה זה

מדובר במודל רב מודאלי זעיר שמקבל טקסט יחד עם וידאו, תמונה בודדת או רצף תמונות, ומחזיר תשובות טקסטואליות. הארכיטקטורה מבוססת על שילוב של מקודד התמונה SigLIP עם מפענח הטקסט SmolLM2, בדומה למבנה של Idefics3. הוא אומן על 3.3 מיליון דוגמאות שמחולקות בעיקר בין וידאו, תמונות וטקסט נקי.

הגודל שלו חריג בנוף של מודלי וידאו, שבדרך כלל מתחילים ממיליארדי פרמטרים. במבחני ביצועים מדעיים כמו Video-MME הוא מגיע לציון של 33.7, ב־MLVU ל־40.6, וב־MVBench ל־32.7. המספרים האלה מראים שהוא מפגר משמעותית אחרי הגרסה של 2.2B שהשיגה 52.1 ב־Video-MME, כך שאי אפשר לצפות ממנו להבנה עמוקה של עלילה, אלא בעיקר למענה על שאלות נקודתיות וזיהוי תבניות בסיסיות.

מתאים ל

  • תיוג וידאו מקומי

    יצירת תיאורים לקטעי וידאו קצרים ישירות על מכשיר הקצה בלי לשלוח מדיה לענן.

  • השוואת תמונות

    קבלת מספר תמונות ושאילתת טקסט כדי לזהות הבדלים או קווי דמיון ביניהן.

  • חילוץ טקסט מתמונה

    קריאת תוכן כתוב מתוך מסמכים ותמונות בעזרת אימון הראייה של SigLIP.

איפה זה נופל

החיסרון המרכזי הוא רמת הדיוק. עם 256 מיליון פרמטרים, המודל סובל מציון נמוך יחסית במבחני וידאו ונוטה להמציא פרטים שנשמעים משכנעים אך אינם נכונים. הכרטיס מזהיר במפורש לא להסתמך עליו בהחלטות קריטיות, סינון מועמדים, חינוך או ניקוד אשראי. בנוסף, הוא אומן על אנגלית בלבד ולא יודע לייצר תמונות או וידאו, אלא רק להחזיר טקסט.

שאלות
נפוצות

האם המודל מבין פקודות בעברית?

הכרטיס מציין רשמית תמיכה בשפה האנגלית בלבד. הנתונים שעליהם הוא אומן מורכבים מטקסט ומולטימדיה באנגלית, כך שהוא לא מיועד לניתוח וידאו או מענה בעברית.

כמה זיכרון כרטיס מסך נחוץ כדי לעבד וידאו?

בזמן הסקה על וידאו המודל צורך רק 1.38GB של GPU RAM בשימוש עם bfloat16. זה מאפשר להריץ אותו גם על כרטיסי מסך חלשים או חומרת קצה מוגבלת.

האם אפשר להשתמש בו לניתוח מצלמות אבטחה?

מסמך המודל אוסר מפורשות על שימוש למעקב לא מורשה וקובע שאינו מתאים לקבלת החלטות קריטיות. ציוני הדיוק הנמוכים הופכים אותו ללא אמין עבור משימות אבטחה.

איך מריצים

ההרצה נעשית דרך ספריית transformers בפייתון, יחד עם החבילות decord לקריאת קובצי וידאו, num2words ו־flash-attn. הקוד טוען את המודל בפורמט bfloat16 ומעביר אותו לכרטיס מסך של אנבידיה שתומך ב־Flash Attention 2.

מבחינת חומרה, המודל דורש רק 1.38GB של VRAM בזמן הסקת וידאו. זה אומר שכל כרטיס מסך ביתי ישן או מאיץ פשוט בענן יריצו אותו בלי מאמץ, ואפשר לפרוס אותו ישירות על מכשירי קצה. אם אתם צריכים ניתוח מורכב של קטעי וידאו ארוכים ברמת דיוק גבוהה, עדיף לפנות ל־API חיצוני חזק, אבל עבור תיוג מקומי ומהיר בלי עלויות ענן, ההרצה העצמית פשוטה וזולה מאוד.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="HuggingFaceTB/SmolVLM2-256M-Video-Instruct")
print(pipe("שלום"))

הרישיון

רישיון Apache 2.0 מתיר שימוש מסחרי ומאפשר להפיץ, לשנות ולשלב את המודל בקוד סגור. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים וציון הרישיון המקורי, בלי אחריות משפטית מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗