GPT
S

SmolVLM-Base

קוד פתוח

HuggingFaceTBapache-2.02024-11-22

  • transformers
  • safetensors
  • idefics3
  • image-text-to-text
  • conversational

מודל ראייה ושפה קומפקטי שמיועד לרוץ מקומית עם מעט מאוד זיכרון גרפי, בלי לוותר על הבנת רצף של טקסט ותמונות.

  • 2.2Bפרמטרים
  • 16,384טוקנים בהקשר
  • 4.2 GBמשקל הקבצים
  • 2,259הורדות בחודש

מה זה

מדובר במודל שמשלב בין מפענח טקסט SmolLM2 לבין מקודד תמונה מסוג SigLIP, בארכיטקטורה שמבוססת על Idefics3. הוא מקבל תמונות וטקסט בכל סדר ומחזיר טקסט, כך שאפשר לתת לו שאילתות על תמונה, לתאר תמונות, לבנות סיפור מכמה תמונות ברצף או אפילו להריץ אותו כמודל שפה רגיל לגמרי. הוא לא יודע לייצר תמונות חדשות.

ההבדל המשמעותי לעומת מודלים מקבילים סביב שני מיליארד פרמטרים הוא יעילות הזיכרון. הוא דוחס כל מקטע תמונה של 384 על 384 לתוך 81 טוקנים ויזואליים בלבד. במבחני הביצועים הוא מקבל 81.6 במבחן DocVQA להבנת מסמכים ו־72.7 במבחן TextVQA. אלה תוצאות נמוכות משל Qwen-VL 2B שמגיע ל־90.1 במסמכים, אבל SmolVLM דורש רק 5.02 גיגה־בייט זיכרון GPU לעומת 13.7 גיגה־בייט אצל המתחרה, מה שהופך אותו לריאלי בהרבה להרצה מקומית.

מתאים ל

  • חילוץ מידע ממסמכים

    הוא אומן על מסדי נתונים ייעודיים למסמכים ומגיע לתוצאה טובה של 81.6 ב־DocVQA בצריכת משאבים נמוכה.

  • תיאור רצף תמונות מקומית

    הוא תומך בשילוב חופשי של כמה תמונות וטקסט ומסתפק בכ־5 גיגה זיכרון GPU בלי צורך בשרתים כבדים.

  • אימון ייעודי למשימות ראייה

    גרסת בסיס קלה של 2.2 מיליארד פרמטרים שמתאימה לכוונון עדין על דאטה פנימי של הארגון.

איפה זה נופל

זהו מודל בסיס ולא גרסת Instruct, כלומר הוא לא אומן לעקוב אחרי הוראות שיחה ומחזיר השלמות טקסט גולמיות. הוא תומך באנגלית בלבד ולא מתאים לעבודה בעברית. יוצרי המודל מזהירים במפורש שהוא נוטה לייצר תוכן שנשמע אמין אך שגוי עובדתית, ולכן הוא אסור לשימוש בקבלת החלטות קריטיות כמו גיוס עובדים, חינוך, מתן אשראי או ניטור.

אותה משפחה

SmolVLM יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לשוחח עם המודל הזה ישירות בפורמט צ'אט?

לא מומלץ. מדובר בגרסת הבסיס שמיועדת להשלמת טקסט ולאימון נוסף, ולא בגרסה שעברה כוונון להוראות ושיחה. לשיחות עדיף להשתמש בגרסת Instruct.

האם המודל מבין מסמכים ותמונות עם טקסט בעברית?

לא. המודל הוגדר ואומן לשפה האנגלית בלבד, ולכן הוא לא יפענח טקסט עברי בתוך תמונות ולא ייצר פלט בעברית תקינה.

כמה זיכרון כרטיס מסך צריך כדי לעבד תמונות גדולות?

ברירת המחדל דורשת כ־5.02 גיגה־בייט ב־bfloat16 עבור תמונות בגודל 1536 על 1536. למסמכים צפופים אפשר להגדיל את הרזולוציה ולשלם ביותר זיכרון, או לכווץ ל־8 ביט כדי לחסוך מקום.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 5.02 גיגה־בייט של זיכרון, בהנחה שמשתמשים ב־bfloat16 או float16. אם הזיכרון לחוץ אפשר לכווץ אותו לקוונטיזציה של 4 או 8 ביט דרך ספריות כמו bitsandbytes, torchao או Quanto, או לשלוט ברזולוציית התמונה בזמן הגדרת המעבד.

בגרסת הבסיס הזו אין התאמה לשיחה מונחית הוראות, ולכן אם המטרה היא צ'אט בוט ישיר עדיף לקחת גרסת Instruct או לקרוא ל־API חיצוני. הרצה מקומית של גרסת הבסיס מתאימה בעיקר כשיש תשתית פרטית ורוצים לאמן אותו ייעודית למשימה מסוימת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="HuggingFaceTB/SmolVLM-Base")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗