GPT
M

Molmo-7B-O-0924

קוד פתוח

allenaiapache-2.02024-09-25

  • transformers
  • safetensors
  • molmo
  • text-generation
  • multimodal

זה מודל ראייה ושפה פתוח מבית היוצר של allenai, שמגיע לביצועים תחרותיים מול ענקיות סגורות בזכות אימון ייעודי על סט נתונים של מיליון תמונות.

  • 7.7Bפרמטרים
  • 4,096טוקנים בהקשר
  • 28.6 GBמשקל הקבצים
  • 1,719הורדות בחודש

מה זה

מדובר במודל רב מודאלי שמחבר בין מודל השפה OLMo-7B-1024 לבין מנוע הראייה CLIP של OpenAI. הוא מאומן על PixMo, סט נתונים ייחודי של מיליון זוגות תמונה וטקסט שנבחר בקפידה. המטרה כאן היא לתת מענה מקומי וחופשי למשימות של ניתוח ויזואלי והבנת שפה.

במדד של 11 מבחנים אקדמיים הוא עומד על ממוצע של 74.6 נקודות, ובמבחני העדפת אנוש הוא מקבל דירוג של 1051. בפועל, המספרים האלה מציבים אותו מעל GPT-4V ולצד מודלים כמו Gemini 1.5 Flash, מה שהופך אותו לאחד הכלים הפתוחים החזקים ביותר בגודל 7B לקריאת תרשימים, מסמכים ושאלות על תמונות.

מתאים ל

  • ניתוח תרשימים וגרפים

    הוא מציג ציונים חזקים במבחני ChartQA ו־DocQA, מה שמאפשר לו לחלץ נתונים מדויקים מתרשימים באנגלית.

  • מענה לשאלות על מסמכים

    השילוב של מודל השפה הפתוח יחד עם עיבוד תמונה מאפשר לקרוא צילומי מסמכים ולענות על שאלות טקסטואליות.

  • ספירת אובייקטים בתמונה

    הוא אומן על מבחני ספירה כמו Flickr Count ומזהה כמויות עצמים בצורה אמינה יותר מרוב מודלי הראייה בגודל שלו.

איפה זה נופל

הגרסה הזו היא preview בלבד, מה שאומר שהקוד המלא וכל שלבי האימון טרם פורסמו רשמית. המודל תומך באנגלית בלבד, ואינו כולל שום התאמה רשמית לעברית.

בנוסף, הכרטיס מדווח בפירוש על כשלים בעיבוד תמונות שקופות, מה שמחייב אתכם להוסיף רקע לבן או כהה ידנית לפני השליחה. יש גם באג ידוע שזורק שגיאה אם התמונה לא מומרת מראש לפרופיל צבע RGB מדויק, כך שאי אפשר להזין קבצים גולמיים בלי שכבת עיבוד מקדים.

שאלות
נפוצות

האם המודל יודע לקרוא עברית מתוך תמונות?

המודל הוגדר ואומן עבור השפה האנגלית בלבד. הוא אינו מיועד לעברית, ולכן ניתוח טקסט עברי מתמונות צפוי להיכשל או להחזיר פלט משובש.

למה מופיעה שגיאת broadcast בעת טעינת תמונה?

השגיאה מתרחשת כאשר התמונה אינה בפורמט צבע RGB, למשל בתמונות בגווני אפור או עם ערוץ שקיפות. הפתרון הוא להמיר את התמונה ל־RGB באמצעות ספריית PIL לפני השליחה למודל.

איך מריצים

המשקלים מגיעים בפורמט float32 ושוקלים 28.6 גיגה בייט, כך שהרצה ישירה ללא המרה תדרוש כרטיס מסך כבד מאוד. המפתחים ממליצים להריץ עם autocast בפורמט bfloat16 או להמיר ישירות את המשקלים כדי לחסוך זיכרון ולעלות על כרטיסים צנועים יותר, אם כי המרה כזו עשויה לשנות מעט את התוצאות.

אפשר להריץ אותו דרך vLLM, אבל יש באג בעיבוד המקדים שמחייב שימוש בגרסה 0.7.2 ומטה עד שייצא תיקון. אם אין לכם חומרה עם לפחות 16 עד 24 גיגה בייט זיכרון גרפי פנוי, עדיף להשתמש ב־API מרוחק במקום להסתבך עם קריסות זיכרון מקומיות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="allenai/Molmo-7B-O-0924")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי, כולל שימוש מסחרי, שינוי הקוד והפצה מחדש. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בכל הפצה של המערכת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗