GPT
M

Molmo-72B-0924

קוד פתוח

allenaiapache-2.02024-09-25

  • transformers
  • safetensors
  • molmo
  • text-generation
  • multimodal

מודל ראייה פתוח שמגיע לביצועים קרובים מאוד ל־GPT-4o במבחני אנוש, ועוקף אותו במבחנים אקדמיים. הוא מתאים למי שחייב מודל מולטימודלי חזק בהרצה עצמית.

  • 73Bפרמטרים
  • 4,096טוקנים בהקשר
  • 273 GBמשקל הקבצים
  • 4,456הורדות בחודש

מה זה

מכון אלן לבינה מלאכותית בנה כאן חיבור ישיר בין גב הראייה של OpenAI CLIP לבין מודל השפה Qwen2-72B, ואימן אותו על דאטה סט ייעודי של מיליון זוגות תמונה וטקסט בשם PixMo.

התוצאות במבחנים מרשימות. בציון ממוצע על פני 11 מבחנים אקדמיים שבודקים מסמכים, תרשימים והבנת תמונות, הוא קיבל 81.2 ועקף מודלים סגורים כמו GPT-4o שקיבל 78.5 ו־Gemini 1.5 Pro שקיבל 78.3. במבחן העדפת בני אדם הוא קיבל ניקוד אלו של 1077, שזה כמעט שווה ל־1079 של GPT-4o ומעל כל מודל פתוח אחר בטבלה. מדובר כרגע בגרסת תצוגה מקדימה, כך ששאר חומרי האימון עדיין לא שוחררו במלואם.

מתאים ל

  • ניתוח תרשימים וגרפים באנגלית

    הוא משיג תוצאות גבוהות במבחני ChartQA ומאפשר חילוץ מידע מתרשימים מורכבים.

  • חילוץ מידע ממסמכים וסריקות

    מתאים לסריקת דפים ותמונות עם טקסט באנגלית הודות לביצועים מובילים במבחני DocQA.

  • ספירת אובייקטים בתמונות

    אומן ונבדק על מבחני CountBenchQA לזיהוי כמות פריטים בתוך סצנה חזותית.

איפה זה נופל

המודל מגיע עם חלון הקשר קצר של 4,096 טוקנים בלבד, מה שמגביל מאוד ניתוח של מסמכים ארוכים או שיחות מורכבות עם כמה תמונות ברצף. בנוסף, הוא מתועד רשמית רק באנגלית ולא מיועד לעברית. יש לו גם בעיות קונקרטיות בעיבוד תמונה: המפתחים מודים שהוא מתקשה עם תמונות שמכילות רקע שקוף ודורש הוספת רקע לבן או שחור מראש, ובנוסף תמונות שאינן בפורמט RGB גורמות לקריסה ומחייבות המרה מוקדמת בקוד.

שאלות
נפוצות

הקוד קורס לי בזמן טעינת תמונה, מה הסיבה?

המודל תומך רק בתמונות בפורמט RGB. אם הקובץ מכיל ערוץ אלפא שקוף או פורמט צבע אחר, צריך להמיר אותו מראש ל־RGB בקוד באמצעות ספריית תמונות כמו PIL כדי למנוע שגיאת broadcast.

למה התשובות על תמונות עם רקע שקוף יוצאות משובשות?

המפתחים מדווחים שהמודל מתקשה להתמודד עם שקיפות. הפתרון הישיר שהם ממליצים עליו הוא להדביק רקע לבן או כהה מאחורי התמונה לפני ששולחים אותה למודל.

איך מריצים

המשקלים יורדים בדיוק של float32 ושוקלים 273 גיגה בייט ב־102 קבצים שונים. כדי בכלל להעלות אותו לזיכרון תצטרכו שרת עם כמה כרטיסי GPU חזקים מאוד, לפחות ארבעה או שמונה כרטיסים של 80 גיגה, אלא אם כן תמירו את המשקלים ל־bfloat16 כפי שהמפתחים מציעים כדי לחסוך מקום. קחו בחשבון שהמפתחים מזהירים שהמרה כזו ל־bfloat16 עלולה לשנות מעט את התוצאות לעומת הרצה במשקלים המקוריים עם autocast בלבד.

אם אתם מתכננים לעבוד עם vLLM, הכרטיס מציין שקיימת כרגע שגיאת עיבוד מוקדם ולכן חובה להשתמש בגרסה 0.7.2 ומטה עד שהתקלה תיפתר. בגלל המשקל והסיבוך הלוגיסטי, אם אין לכם כבר תשתית שרתים מוכנה ופעילה עבור מודלים של 70B ומעלה, ההרצה העצמית הזו תהיה יקרה וכבדה מאוד לתחזוקה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="allenai/Molmo-72B-0924")
print(pipe("שלום"))

הקבצים

102 קבצים במאגר, 273 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט עצמו מופץ תחת רישיון apache-2.0 שמתיר שימוש מסחרי, שינוי והפצה של הקוד. עם זאת, המודל מבוסס על Qwen2-72B וכפוף גם לתנאי הרישיון המקוריים שלו, והמפתחים מציינים שהוא נועד למחקר ולחינוך ומפנים להנחיות שימוש אחראי של מכון אלן. כדאי לבדוק את תנאי הרישיון של Qwen לפני שילוב שלו במערכת ייצור מסחרית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗