GPT
S

SmolVLM-256M-Instruct

קוד פתוח

HuggingFaceTBapache-2.02025-01-17

  • transformers
  • onnx
  • safetensors
  • idefics3
  • image-text-to-text

מודל ראייה ושפה זעיר שרץ על פחות מגיגה זיכרון גרפי ומבין תמונות באנגלית. הוא נותן מענה מקומי למכשירים חלשים שלא יכולים לפנות לענן.

  • 256Mפרמטרים
  • 8,192טוקנים בהקשר
  • 3.3 GBמשקל הקבצים
  • 470,680הורדות בחודש

מה זה

המודל הזה משלב מפענח שפה של 135 מיליון פרמטרים ממשפחת SmolLM2 יחד עם מקודד תמונה SigLIP מכווץ בגודל 93 מיליון פרמטרים. הוא מקבל רצף חופשי של טקסט ותמונות ומייצר תשובות טקסטואליות, כולל תיאור תמונות, מענה לשאלות ויזואליות וחילוץ טקסט.

הייחוד שלו הוא דחיסת תמונה אגרסיבית שמשתמשת בשישים וארבעה טוקנים ויזואליים בלבד לחתיכות של 512 על 512 פיקסלים. במבחני ביצועים רואים שהוא מחזיק ציון סביר של 58.3 בבדיקות מסמכים מסוג DocVQA וציון של 73.6 בשאלות מדעיות, אבל נופל משמעותית מגרסת ה־2.2B במשימות מורכבות כמו Mathvista שם הוא מגיע ל־35.9 בלבד.

מתאים ל

  • חילוץ נתונים ממסמכים

    רבע מנתוני האימון הוקדשו למסמכים, מה שמספק תוצאה יציבה של 58.3 ב־DocVQA על חומרה בסיסית.

  • תיאור תמונות בקצה

    רץ בפחות מגיגה זיכרון גרפי ומתאים לתיוג ויזואלי מהיר ישירות על מכשירים ללא חיבור רשת.

  • קריאת גרפים פשוטים

    מגיע לתוצאה של 55.8 במבחן ChartQA ומאפשר לנתח תרשימים באנגלית בעלות חישוב אפסית.

איפה זה נופל

המודל אומן על אנגלית בלבד ולא יבין פניות בעברית. יוצרי המודל מדגישים שהוא מייצר תוכן שנראה עובדתי אך עלול להיות שגוי, ואוסרים במפורש על שימוש בו לקבלת החלטות קריטיות, הערכת בני אדם, תעסוקה או אשראי. במבחני הבנה כלליים ומתמטיקה מורכבת הציונים שלו נמוכים מאוד, כך שהוא לא מתאים למשימות היסק שדורשות לוגיקה מעבר לזיהוי ויזואלי פשוט.

אותה משפחה

SmolVLM יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעבודה עם תמונות בעברית?

לא. המודל אומן על נתונים באנגלית בלבד ומוגדר לשפה זו. הוא יתקשה מאוד לקרוא טקסט עברי מתוך תמונות או לענות בעברית, ולכן לשימוש מקומי בארץ תידרשו לאמן אותו מחדש.

האם אפשר להשתמש בו לייצור תמונות מטקסט?

לא, המודל פועל במבנה של תמונה וטקסט כקלט וטקסט בלבד כפלט. הוא יודע להסביר מה מופיע בתמונה או לחלץ מתוכה פרטים, אך אינו כולל יכולת לחולל קובצי תמונה.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפורמט bfloat16 על כרטיס מסך, או מריצים את משקלי ה־ONNX הזמינים עם ONNX Runtime למעבדים חלשים. אפשר לקוונטט אותו ל־4 או 8 ביט כדי לצמצם את צריכת הזיכרון עוד יותר, ולשלוט ברזולוציה בעזרת חלוקת התמונה לחלקים קטנים יותר כדי לחסוך משאבים.

המודל דורש פחות מגיגה־בייט בודד של זיכרון גרפי לתמונה, מה שאומר שאפשר להרים אותו על כמעט כל מחשב או מעבד מקומי. שווה לפנות ל־API חיצוני רק כשצריך ניתוח מסמכים מסובך באמת או הבנה של שפות אחרות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="HuggingFaceTB/SmolVLM-256M-Instruct")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי חופשי לחלוטין. מותר להריץ, לשנות, לארח במוצר סגור ולהפיץ אותו, בתנאי ששומרים על הודעת זכויות היוצרים וכתב הוויתור המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗