GPT
S

SmolVLM-Instruct

קוד פתוח

HuggingFaceTBapache-2.02024-11-18

  • transformers
  • onnx
  • safetensors
  • idefics3
  • image-text-to-text

זה מודל מולטימודלי קומפקטי שמסוגל לעבד רצפי תמונות וטקסט יחד. הוא מיועד למי שצריך ראייה ממוחשבת מקומית על חומרה חלשה בלי לשלם על API חיצוני.

  • 2.2Bפרמטרים
  • 16,384טוקנים בהקשר
  • 27.5 GBמשקל הקבצים
  • 36,355הורדות בחודש

מה זה

מדובר במודל שמשלב בין מקודד התמונות SigLIP לבין מודל השפה SmolLM2, בארכיטקטורת Idefics3. הוא מקבל שילוב חופשי של טקסט ותמונות, מבין מסמכים, עונה על שאלות חזותיות ויודע לכתוב תיאורים מפורטים. בניגוד לפתרונות כבדים, הדגש כאן הוא דחיסת תמונה חריפה, שבה כל מקטע של 384 על 384 פיקסלים מומר ל־81 טוקנים חזותיים בלבד כדי לחסוך זיכרון ולרוץ מהר.

במדדים הוא מציג פשרות ברורות. במבחני הבנת מסמכים כמו DocVQA הוא מגיע לציון 81.6, קרוב מאוד למודלים גדולים ממנו, אבל צורך רק כ־5.02 גיגה־בייט של זיכרון גרפי, לעומת יותר מ־13 גיגה־בייט שדורש Qwen-VL 2B שמנצח אותו בביצועים. במבחני ידע כללי מורכבים כמו MMMU הוא מסתפק ב־38.8 נקודות, כך שרואים בבירור שהחיסכון בחומרה בא על חשבון יכולות הסקה מתקדמות.

מתאים ל

  • חילוץ מידע ממסמכים

    מאומן חזק על דאטה־סטים של מסמכים ומגיע לתוצאה יפה של 81.6 ב־DocVQA בצריכת זיכרון מינימלית.

  • עיבוד רצף תמונות מקומי

    דחיסת התמונה ל־81 טוקנים מאפשרת להזין רצפי פריימים יחד בלי לחנוק את הזיכרון של כרטיס המסך.

  • מענה קולי חזותי במכשיר קצה

    הוא דורש כ־5 גיגה זיכרון גרפי, מה שמתאים לחומרה מוזלת שרצה קרוב לשטח בלי חיבור לאינטרנט.

איפה זה נופל

הוא מוגדר רשמית באנגלית בלבד, כך שאי אפשר לסמוך עליו בעברית בלי אימון ייעודי. הכרטיס מזהיר במפורש שהוא עלול להמציא דברים שנשמעים עובדתיים לחלוטין אבל שגויים לגמרי. הוא לא מתאים לקבלת החלטות קריטיות שמשפיעות על בני אדם כמו גיוס, ציונים או אשראי, ואין לו שום יכולת לייצר תמונות, אלא רק לפלוט טקסט.

אותה משפחה

SmolVLM יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ אותו על מחשב בלי כרטיס מסך חזק?

כן, המודל תוכנן מראש לחומרה מוגבלת ודורש רק כ־5.02 גיגה־בייט זיכרון גרפי בגרסת הבסיס. אם משתמשים בכימות ל־8 או 4 ביט דרך bitsandbytes, דרישות הזיכרון צונחות עוד יותר ומתאימות לכרטיסים פשוטים.

הוא יודע לקרוא עברית מתמונות או לענות בעברית?

הכרטיס מצהיר על תמיכה בשפה האנגלית בלבד. הוא לא אומן על עברית, ולכן ניסיון לחלץ ממנו טקסט בעברית ממסמכים או לנהל איתו שיחה ייתקל בהזיות ובביצועים ירודים.

למה לבחור בו ולא במודלים כמו Qwen-VL 2B?

הסיבה המרכזית היא חיסכון דרסטי במשאבים. Qwen-VL משיג תוצאות טובות יותר ברוב המבחנים אך דורש כ־13.7 גיגה זיכרון, בעוד SmolVLM מסתפק בכשליש מכך ומציע מהירות עיבוד גבוהה יותר.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון. במצב רגיל של bfloat16 הוא דורש קצת מעל 5 גיגה־בייט בזיכרון ה־GPU, מה שמאפשר להריץ אותו בקלות על כרטיס מסך ביתי בסיסי. אפשר גם לכווץ אותו ל־4 או 8 ביט באמצעות bitsandbytes ולחסוך עוד יותר מקום.

אם אתם צריכים רק מדי פעם לחלץ טקסט מתמונה בודדת או רוצים דיוק מקסימלי במבחנים מורכבים, חבל על ההתעסקות בהקמת שרת ותחזוקה. במקרה כזה עדיף לשלם סנטים בודדים ל־API מסחרי גדול. מקומי שווה את זה בעיקר כשמעבדים כמויות אדירות של פריימים או כשהמידע רגיש ולא יכול לצאת מהרשת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="HuggingFaceTB/SmolVLM-Instruct")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗