GPT
S

SmolVLM-500M-Instruct

קוד פתוח

HuggingFaceTBapache-2.02025-01-20

  • transformers
  • onnx
  • safetensors
  • idefics3
  • image-text-to-text

מודל ראייה ושפה קטן במיוחד שנועד לרוץ מקומית על חומרה חלשה. הוא מקבל שילוב של תמונות וטקסט ומחזיר תשובות באנגלית בלי להעמיס על הזיכרון.

  • 507Mפרמטרים
  • 8,192טוקנים בהקשר
  • 6.4 GBמשקל הקבצים
  • 107,260הורדות בחודש

מה זה

המודל משלב מפענח טקסט קל ממשפחת SmolLM2 עם מקודד תמונה SigLIP מכווץ בגודל 93 מיליון פרמטרים. המבנה מבוסס על ארכיטקטורת Idefics3, אך כולל דחיסת תמונה אגרסיבית יותר. במקום טלאים קטנים, הוא שולח למקודד טלאים בגודל 512 על 512 ומקודד כל אחד לתוך 64 טוקנים ויזואליים בלבד.

האימון שלו נשען על המאגרים The Cauldron ו־Docmatix, עם דגש חזק של 25 אחוז על הבנת מסמכים ו־18 אחוז על תיאור תמונות, לצד קריאת גרפים ומענה על שאלות. התוצאה היא מודל שמסוגל לתמלל טקסט מתוך תמונה, לנתח מסמך או לענות על שאלות ויזואליות תוך שימוש בזיכרון מינימלי, אך הוא מייצר טקסט בלבד ולא תמונות.

מתאים ל

  • חילוץ מידע ממסמכים

    רבע מנתוני האימון הוקדשו למסמכים, מה שמאפשר לו לשלוף שדות וטקסט מקבצים סרוקים באנגלית.

  • הרצה מקומית על מחשב קצה

    צריכת הזיכרון עומדת על 1.23GB בלבד לתמונה, מה שמאפשר לו לפעול על חומרה חלשה ללא חיבור רשת.

  • תיאור תמונות ותיוג

    הוא מנתח תוכן ויזואלי ומייצר תיאורים תמציתיים באנגלית ביעילות ובמהירות גבוהה.

איפה זה נופל

המודל אומן על אנגלית בלבד. אין לו תמיכה רשמית בעברית, ולכן ניסיון לחלץ ממנו מסמכים בעברית או לקבל תשובות מקומיות יוביל לשגיאות או להזיות. מעבר לזה, הכרטיס מזהיר במפורש שהתוכן שהוא מייצר עשוי להיראות עובדתי אך להיות שגוי לחלוטין. הוא אינו מיועד למערכות קריטיות של קבלת החלטות, בדיקת אשראי או תעסוקה. הדחיסה הגבוהה של התמונות חוסכת זיכרון, אך היא גובה מחיר כשנדרשת ירידה לפרטים קטנים ומורכבים.

אותה משפחה

SmolVLM יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו בעברית?

המודל תומך רשמית באנגלית בלבד. הוא לא אומן על טקסטים או מסמכים בעברית, ולכן לא יתאים למשימות מקומיות בלי אימון ייעודי נוסף.

האם המודל יודע לייצר תמונות חדשות?

לא. מדובר במודל שמקבל תמונות וטקסט ומחזיר טקסט בלבד. הוא יודע לענות על שאלות לגבי תמונה קיימת אך לא לצייר או לערוך אותה.

איך מריצים

טוענים את המודל ישירות דרך ספריית transformers ב־bfloat16. להרצת תמונה בודדת נדרש זיכרון וידאו של 1.23GB בלבד, כך שכרטיס מסך בסיסי או מחשב מקומי פשוט יספיקו בלי בעיה. אם חסר זיכרון, אפשר להפעיל קוונטיזציה של 4 או 8 ביט עם ספריות כמו bitsandbytes, או להקטין את רזולוציית התמונה בעיבוד המקדים.

אם כל מה שאתם צריכים זה ניתוח של אלפי תמונות ביום בשרת מרוחק עם מעבד חזק, מודלים גדולים יותר דרך ספקי ענן יתנו דיוק עדיף. המודל הזה שווה הרצה עצמית רק כשאתם חייבים תגובה ישירות על המכשיר של המשתמש, או כשרוצים לחסוך לחלוטין עלויות תשתית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="HuggingFaceTB/SmolVLM-500M-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לאמן אותו מחדש ולשלב אותו במוצרים סגורים. התנאים העיקריים הם שמירה על הצהרת זכויות היוצרים והרישיון המקורי, בלי אחריות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗