GPT
N

nanoVLM-222M

קוד פתוח

lusxvrapache-2.02025-05-01

  • nanovlm
  • safetensors
  • vision-language
  • multimodal
  • pytorch

מודל ראייה ושפה ששוקל פחות מגיגהבייט ורץ על קוד פשוט ונקי. הוא מיועד למי שרוצה לחקור ולשנות ארכיטקטורה מולטימודלית בלי להסתבך עם ספריות ענקיות.

  • 222Mפרמטרים
  • 847 MBמשקל הקבצים
  • 1,011הורדות בחודש
  • 103לייקים

מה זה

מדובר בחיבור ישיר בין מקודד התמונות SigLIP בגרסת 85 מיליון פרמטרים לבין מודל השפה הקטן SmolLM2 של 135 מיליון פרמטרים. כל המבנה הזה נכנס לקובץ פייתון קצרצר של כ־750 שורות קוד ב־PyTorch טהור, בלי שכבות הפשטה מיותרות מסביב.

במבחן MMStar הוא הגיע לציון של 35.3 אחוז דיוק אחרי אימון של שש שעות בלבד על מעבד גרפי בודד מסוג H100, מול מאגר the cauldron. בפועל, התוצאה הזו מראה שהוא בעיקר הוכחת יכולת ונקודת מוצא למחקר, ולא תחליף למודלים שרואים ומבינים סצנות מורכבות ברמת דיוק מסחרית.

מתאים ל

  • מחקר וניסוי בארכיטקטורה

    כל הקוד יושב ב־750 שורות PyTorch פשוטות שקל לקרוא, לפרק ולשנות.

  • אימון מקומי זול

    המודל אומן כולו בשש שעות על כרטיס H100 בודד, מה שמוזיל ניסויי אימון מחדש.

  • בדיקת יכולות על מכשירי קצה

    גודל של 847 מגהבייט מאפשר להעלות אותו לבדיקות מהירות גם בלי חומרה ייעודית.

איפה זה נופל

עם ציון של 35.3 אחוז במבחן MMStar, המודל הזה יטעה לעיתים קרובות. הוא מתקשה להבין פרטים קטנים, יחסים מורכבים במרחב או טקסטים שמופיעים בתוך תמונות. מודל שפה של 135 מיליון פרמטרים מייצר הזיות בקלות ומסוגל לנסח רק תשובות פשוטות מאוד, כך שאי אפשר להסתמך עליו למשימות שדורשות הבנה מעמיקה בלי לבדוק כל פלט ידנית.

שאלות
נפוצות

האם המודל מבין עברית?

המודל מתבסס על SmolLM2 ואומן על מאגר the cauldron באנגלית. הוא לא נבדק על עברית ולא מיועד לזה, כך שסביר להניח שיחזיר שגיאות או ג'יבריש בניסיון לפנות אליו בעברית.

האם אפשר להריץ אותו עם ספריית transformers הרגילה?

הכרטיס מפנה להרצה דרך קוד ייעודי מתוך מאגר הגיטהאב של nanoVLM. צריך לייבא את המחלקה VisionLanguageModel מהמאגר עצמו כדי לטעון את המשקלים מקבצי המקור.

איך מריצים

המודל שוקל 847 מגהבייט בלבד, כך שלא צריך שרת מיוחד כדי להפעיל אותו. הוא יעלה וירוץ כמעט על כל כרטיס מסך בסיסי ואפילו על מעבד רגיל במחשב נייד, ישירות מתוך המאגר של ספריית nanovlm.

אם אתם צריכים זיהוי תמונה יציב ומדויק למוצר חי, עדיף להשתמש ב־API של מודלים גדולים ומבוססים יותר. ההרצה העצמאית כאן מתאימה רק אם אתם רוצים לאמן מחדש, לשנות את שכבת הצימוד, או ללמוד איך מודל ראייה בנוי מבפנים.

pip install -U huggingface_hub
hf download lusxvr/nanoVLM-222M

הקבצים

4 קבצים במאגר, 847 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש. מותר לשלב אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗