GPT
S

SmolVLM2-500M-Video-Instruct

קוד פתוח

HuggingFaceTBapache-2.02025-02-11

  • transformers
  • onnx
  • safetensors
  • smolvlm
  • image-text-to-text

עיבוד וידאו מקומי בדרך כלל דורש שרת כבד, אבל כאן יש מודל מולטימודלי של חצי מיליארד פרמטרים שרץ על כמעט כל כרטיס מסך. פתרון ממוקד למי שחייב ניתוח פריימים בלי לשלוח מדיה החוצה.

  • 507Mפרמטרים
  • 8,192טוקנים בהקשר
  • 7.4 GBמשקל הקבצים
  • 1,411,432הורדות בחודש

מה זה

מדובר במודל שמקבל שילוב חופשי של טקסט, תמונות בודדות, רצפי תמונות וסרטוני וידאו, ומחזיר טקסט באנגלית. הבסיס שלו משלב את מפענח השפה SmolLM2 יחד עם SigLIP כמעבד תמונה, בארכיטקטורה שנשענת על Idefics3. הוא יודע לענות על שאלות לגבי וידאו, להשוות בין קבצי מדיה שונים ולתמלל טקסט מתוך תמונות.

במבחני ביצועים מדעיים לווידאו הוא מציג תמונה ברורה לגבי הפשרות של הגודל שלו. במבחן Video-MME הוא מגיע לציון 42.2, ב־MLVU ל־47.3, וב־MVBench ל־39.73. התוצאות האלה נמוכות בערך בחמש עד עשר נקודות מגרסת ה־2.2B של אותה משפחה, מה שאומר שתקבלו הבנה סבירה של התרחשות כללית בתוך סצנה, אבל אל תבנו עליו לתפוס פרטים קטנים או פעולות קצרות ומהירות שנבלעות ברקע.

מתאים ל

  • ניתוח וידאו במכשירי קצה

    צורך רק 1.8GB זיכרון כרטיס מסך, מה שמתאים לחומרה מוגבלת באתר הלקוח ללא תלות ברשת.

  • מענה על שאלות מתמונות

    מאפשר לשלב תמונות ושאילתות טקסט ביחד לחילוץ מידע ותיאור ויזואלי מהיר באנגלית.

  • השוואת מספר תמונות

    הארכיטקטורה תומכת בערבוב של כמה תמונות ברצף אחד, ומזהה הבדלים בלי פירוק ידני מורכב.

איפה זה נופל

המודל מוגדר ומאומן באנגלית בלבד, כך שאינו מיועד לפענוח או יצירה של טקסט בעברית. הוא מייצר טקסט בלבד ולא יכול ליצור תמונות או קטעי וידאו בעצמו. מעבר לכך, מפתחיו אוסרים במפורש שימוש בו לקבלת החלטות קריטיות, דירוג בני אדם, מעקב או שימושים בעלי סיכון גבוה, בגלל נטייה לייצר תוכן שנשמע אמין אך שגוי עובדתית.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות על סרטוני וידאו בעברית?

לא. המודל מאומן לחלוטין באנגלית, הן להוראות והן לפלט. אפשר לתת לו וידאו שצולם בישראל, אבל השאלות והתשובות חייבות להיות באנגלית.

האם הוא מסוגל לייצר לי סרטון וידאו לפי תיאור?

לא, המשימה שלו היא image-text-to-text בלבד. הוא מסוגל לקרוא ולהבין מדיה ויזואלית, אבל הפלט שהוא מחזיר תמיד יהיה מחרוזת טקסט.

איזה כרטיס מסך צריך בשביל להריץ אותו בצורה מקומית?

הסקה על וידאו דורשת בערך 1.8GB של זיכרון וידאו בלבד. כל כרטיס מסך מודרני בסיסי של אנבידיה יספיק כדי להרים אותו בלי בעיות.

איך מריצים

בפועל מריצים אותו ישירות דרך ספריית transformers של פייתון, יחד עם הספריות decord לטעינת וידאו ו־flash-attn לחישוב יעיל. הכרטיס מציין שהרצת מודל לווידאו תופסת כ־1.8GB של זיכרון בכרטיס המסך כשעובדים ב־bfloat16. זה נתון נמוך מאוד שמאפשר להריץ אותו אפילו על מחשבים ניידים עם GPU בסיסי או במכשירי קצה מקומיים.

אין שום סיבה לשלם על API חיצוני כשצורכי העיבוד שלכם פשוטים והחומרה שלכם עומדת בדרישות האלה. אם יש לכם צורך לנתח מאות אלפי שעות וידאו בזמן אמת, או שאתם חייבים דיוק גבוה יותר שלא קיים ב־500M פרמטרים, אז כדאי לשקול מודלים גדולים יותר דרך שרת מרוחק.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="HuggingFaceTB/SmolVLM2-500M-Video-Instruct")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר ברישיון apache-2.0 חופשי. הרישיון מאפשר שימוש מסחרי, שינוי קוד והפצה של המודל בתוך מוצרים פרטיים או מסחריים, ללא תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗