GPT
M

Molmo2-4B

קוד פתוח

allenaiapache-2.02025-12-14

  • transformers
  • safetensors
  • molmo2
  • image-text-to-text
  • multimodal

מודל ראייה ושפה קומפקטי שיודע להצביע על אובייקטים בתמונות ובווידאו. הוא מתאים למי שחייב ניתוח וידאו מקומי בלי לשלוח פריימים לענן.

  • 4.9Bפרמטרים
  • 36,864טוקנים בהקשר
  • 18.1 GBמשקל הקבצים
  • 106,972הורדות בחודש

מה זה

מדובר במודל שמשלב את מודל השפה Qwen3-4B-Instruct יחד עם SigLIP 2 בתור רכיב הראייה. הוא תומך בהבנה של תמונות בודדות, רצף תמונות וסרטוני וידאו, וכולל יכולות של הצבעה ומיקום מרחבי, כלומר זיהוי איפה נמצא אלמנט מסוים בתוך הפריים.

לפי הבדיקות של המפתחים ב־15 מבחנים אקדמיים, המודל הגיע לציון ממוצע של 62.8 נקודות. המספר הזה עוקף מודלים פתוחים אחרים בקטגוריית המשקל שלו כמו Qwen3-VL-4B שקיבל 58.1, ומשאיר מאחור אפילו מודלים סגורים גדולים כמו Claude Sonnet 4.5 שנמדד שם על 59.6. בפועל, החוזק העיקרי שמדווח הוא בסרטונים קצרים, ספירת עצמים ותיאור תמונות.

מתאים ל

  • מעקב וידאו והצבעה

    זיהוי וסימון מיקום של אובייקטים לאורך ציר הזמן בסרטונים קצרים.

  • ספירת פריטים בתמונה

    משימות ספירה ויזואלית מדויקת שבהן המודל הציג יתרון מובהק על מתחרים.

  • ניתוח רצף תמונות

    מענה על שאלות שמבוססות על כמה תמונות יחד בהקשר רחב.

איפה זה נופל

הכרטיס מציין שהמודל אומן על אנגלית בלבד, כך שלא כדאי לבנות עליו לפענוח טקסטים או שיחה בעברית. בנוסף, למרות ביצועים תחרותיים בווידאו ארוך, המפתחים מודים שהיתרון הבולט שלו הוא דווקא בסרטונים קצרים. החיסרון המשמעותי ביותר מסתתר באותיות הקטנות, שכן חלק מנתוני האימון הגיעו ממאגרים שמותרים למחקר אקדמי בלבד, מה שמייצר סיכון משפטי ברור במוצר מסחרי.

אותה משפחה

Molmo2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לניתוח טקסט בעברית מתוך תמונות?

המודל מוגדר רשמית לאנגלית בלבד. הוא לא תוכנן לפענוח עברית, וסביר להניח שישבש קריאת שלטים, מסמכים או שאלות בשפה זו.

האם אפשר להטמיע אותו במערכת מסחרית בלי חשש?

לא מומלץ בלי בדיקה. למרות רישיון apache-2.0, המפתחים מציינים שדאטהסטים מסוימים מהאימון מוגבלים למחקר בלבד, מה שעלול לחשוף אתכם להפרת תנאים.

איך מריצים

כדי להריץ אותו צריך סביבת פייתון 3.11 עם חבילות כמו transformers בגרסה 4.57.1, torch, torchvision, decord2 וספריית עזר ייעודית בשם molmo_utils. קבצי המשקולות שוקלים 18.1 גיגה בייט, כך שצריך כרטיס מסך עם לפחות 24 גיגה זיכרון כדי לטעון אותו ישירות ולעבד חלון הקשר ארוך עם פריימים של וידאו.

אם אתם צריכים לנתח סרטונים בודדים פעם ביום או שאין לכם חומרה ייעודית פנויה, החזקה של כרטיס כזה תהיה יקרה ומיותרת, ועדיף להשתמש ב־API חיצוני. לעומת זאת, אם יש לכם צורך בעיבוד רציף או מקומי מטעמי פרטיות, הגודל הזה מאפשר ריצה סבירה על שרת יחיד.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="allenai/Molmo2-4B")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון apache-2.0, שלכאורה מתיר שימוש מסחרי חופשי ושינוי קוד. יחד עם זאת, המפתחים מבהירים שהמודל אומן על נתוני צד שלישי המוגבלים למחקר אקדמי ולא מסחרי בלבד, ומיועד למחקר וחינוך. לכן, שילוב שלו במוצר מסחרי בפועל דורש בדיקה משפטית זהירה של מקורות המידע.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗