GPT
M

MolmoE-1B-0924

קוד פתוח

allenaiרישיון לא דווח2024-09-24

  • transformers
  • pytorch
  • molmo
  • text-generation
  • multimodal

מודל ראייה ושפה שמבוסס על שילוב מומחים, עם ביצועים שמתקרבים למודלים סגורים גדולים בהרבה. הוא מפעיל מעט פרמטרים בכל שלב ומיועד למי שצריך ניתוח תמונה מדויק בחומרה עצמית.

  • 32,768טוקנים בהקשר
  • 26.9 GBמשקל הקבצים
  • 1,865הורדות בחודש
  • 157לייקים

מה זה

מדובר במודל ראייה ושפה רב-מודאלי שמבוסס על ארכיטקטורת Mixture-of-Experts. בפועל יש לו 7.2 מיליארד פרמטרים בסך הכול, אבל בכל מעבר מופעלים רק 1.5 מיליארד מהם. המודל אומן על PixMo, מאגר שמכיל מיליון זוגות של תמונה וטקסט שנבחרו ונאספו בקפידה על ידי מכון אלן לבינה מלאכותית.

במדדי הערכה אקדמיים שבדקו גרפים, מסמכים והבנה כללית, הוא הגיע לציון ממוצע של 68.6 נקודות, ובמבחני העדפת אנוש קיבל דירוג Elo של 1032. המספרים האלה מציבים אותו קרוב מאוד לרמה של מודלים ענקיים כמו GPT-4V במבחנים האלה, וגבוה בהרבה מרוב המודלים הפתוחים בסדרי גודל דומים.

מתאים ל

  • ניתוח תרשימים ומסמכים

    המודל נבדק ישירות על משימות DocQA ו־ChartQA ומראה רמת דיוק טובה בהבנת טקסטים מתוך גרפים וקובצי תמונה.

  • ספירת אובייקטים בתמונה

    הוא כולל אימון ייעודי על מבחני CountBench ו־Flickr Count שבוחנים זיהוי כמותי של עצמים בצורה ממוקדת.

  • עיבוד תמונה מקומי ופרטי

    מתאים למי שרוצה יכולות ראייה ברמה קרובה למודלים מסחריים בלי להוציא מידע רגיש מחוץ לתשתית המקומית.

איפה זה נופל

הגרסה הזו מוגדרת כגרסת תצוגה מקדימה, כך שלא כל חומרי האימון והקוד המלא שוחררו עדיין. מעבר לזה, המפתחים מודים שהמודל מתקשה להתמודד עם תמונות שמכילות שקיפות, מה שמחייב אתכם להוסיף להן רקע לבן או כהה לפני השליחה. בנוסף, חובה לוודא שכל תמונה מומרת למצב צבע RGB, אחרת המערכת קורסת עם שגיאות עיבוד.

שאלות
נפוצות

למה מופיעה לי שגיאת broadcast כשאני מנסה לעבד תמונה?

המודל דורש תמונות במבנה צבע של שלושה ערוצים. אם התמונה שלכם היא בגווני אפור או בפורמט אחר, צריך להמיר אותה לפורמט RGB באמצעות ספריית עיבוד התמונה לפני השליחה.

האם המודל יודע להתמודד עם קובצי PNG עם רקע שקוף?

לא בצורה טובה. המפתחים מדווחים שהמודל מתקשה להבין אזורים שקופים, וממליצים להוסיף לתמונה רקע לבן או שחור אחיד לפני שמעבירים אותה אליו.

איך מריצים

כדי להריץ אותו צריך התקנה פשוטה של transformers יחד עם einops ו־torchvision. הקבצים שוקלים 26.9 גיגה-בייט, כך שתצטרכו כרטיס מסך עם מספיק זיכרון VRAM כדי להחזיק את כל 7.2 מיליארד הפרמטרים, למרות שבזמן החישוב עצמו פעילים רק 1.5 מיליארד.

אם אין לכם שרת ייעודי עם מעבד גרפי מתאים, או שאתם לא צריכים שליטה מלאה בנתונים ובזמני התגובה, עדיף להשתמש ב־API חיצוני או בדמו שהחוקרים העלו ולא להתעסק עם החזקת שרת כבד כזה בעצמכם.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="allenai/MolmoE-1B-0924")
print(pipe("שלום"))

הרישיון

במטא-דאטה של הדף לא צוין רישיון, אבל בטקסט עצמו החוקרים כותבים שהמודל משוחרר תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש חופשי וגם מסחרי, אך הם מציינים במפורש שהוא מיועד כרגע למחקר ולחינוך ומפנים לקווי השימוש האחראי שלהם. אי-ההתאמה הזו דורשת זהירות משפטית לפני שילוב שלו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗