GPT
M

MiniMax-VL-01

קוד פתוח

MiniMaxAIרישיון לא דווח2025-01-12

  • safetensors
  • minimax_vl_01
  • image-text-to-text
  • conversational
  • custom_code

מודל ענק שמנתח תמונות ומסמכים ומסוגל להפעיל פונקציות חיצוניות. הוא מיועד למי שרוצה ביצועים ברמה של המודלים המובילים בשוק, בתנאי שיש לו תשתית מתאימה להרצת מפלצת כזו.

  • 456Bפרמטרים
  • 8,192טוקנים בהקשר
  • 853 GBמשקל הקבצים
  • 27,242הורדות בחודש

מה זה

מדובר במודל שמשלב רשת ראייה של 303 מיליון פרמטרים יחד עם מודל שפה של 456 מיליארד פרמטרים. המערך הזה מעבד תמונות ברזולוציה משתנה, מריבועים של 336 על 336 ועד 2016 על 2016 פיקסלים, על ידי חלוקה למקטעים וחיבור שלהם לתמונה מלאה. בנוסף לקריאת תמונות וטקסט, המודל מחזיר קריאות לפונקציות במבנה ג'ייסון תואם לממשק של OpenAI.

במדדים שפורסמו הוא מציג תוצאות מעניינות. במבחני OCRBench ו־ChartQA הוא מוביל על פני GPT-4o ו־Claude 3.5 Sonnet, מה שמצביע על יכולת גבוהה מאוד בפענוח גרפים ומסמכים סרוקים. לעומת זאת, במבחני מתמטיקה מורכבים כמו OlympiadBench הוא נשאר מאחור עם ציון 24.2 לעומת 46.1 של Gemini 2.0 Flash.

מתאים ל

  • ניתוח דוחות ותרשימים

    הוא השיג ציון מוביל של 91.7 במבחן ChartQA, ולכן מתאים לחילוץ מדויק של נתונים מגרפים.

  • זיהוי תווים במסמכים מורכבים

    עם ציון 865 ב־OCRBench, המודל מתמודד מצוין עם קריאת טקסטים קשים מתוך תמונות.

  • הפעלת פונקציות מבוססות תמונה

    תומך בקריאת פונקציות מובנית בפורמט ג'ייסון, מה שמתאים לחיבור תמונות למערכות חיצוניות.

איפה זה נופל

חלון ההקשר עומד על 8,192 טוקנים בלבד. עבור מודל שמעבד תמונות ברזולוציה גבוהה שמייצרות כמות גדולה של טוקנים ויזואליים, מדובר במגבלה קשה שמשאירה מעט מאוד מקום לטקסט ולשיחות ארוכות. מעבר לכך, במתמטיקה מתקדמת הביצועים שלו נמוכים משמעותית מהמתחרים, ובמבחן ההקשר הארוך M-LongDoc הוא השיג רק 32.5 אחוזי דיוק. אין גם נתונים על התנהגות בעברית, ולכן חובה לבדוק תמיכה בשפה לפני שמתכננים עליו מוצר מקומי.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת של חברה ממוצעת?

לא בלי השקעה עצומה. הקבצים שוקלים 853 גיגה בייט ומספר הפרמטרים עומד על 456 מיליארד, כך שצריך אשכול שרתים מרובה כרטיסי מסך יקרים רק כדי לטעון אותו לזיכרון.

איך המודל מסתדר עם תמונות ברזולוציה גבוהה?

הוא משתמש במנגנון רזולוציה דינמית שמחלק תמונות מגודל 336 על 336 ועד 2016 על 2016 למקטעים נפרדים, ומעבד אותם יחד עם תמונה ממוזערת.

האם המודל מתאים לפתרון בעיות מתמטיות קשות?

פחות. במבחן OlympiadBench הוא קיבל תוצאה של 24.2, שנמוכה משמעותית מרוב המודלים המובילים בקטגוריה.

איך מריצים

כדי להריץ אותו עצמאית נדרש מערך חומרה כבד ביותר. המשקלים לבדם תופסים 853 גיגה בייט בפורמט bfloat16 ומחולקים למאות קבצים, כך שאין שום דרך להרים אותו על שרת בודד רגיל בלי אשכול של מעבדים גרפיים ייעודיים עם זיכרון כולל של טרה בייט ומעלה.

היוצרים מפנים להרצה באמצעות vLLM עבור סביבות ייצור. לרוב המפתחים והצוותים המקומיים, העלות והתחזוקה של שרתים כאלה לא הגיוניות, ועדיף להשתמש ב־API שהחברה מציעה דרך הפלטפורמה שלה.

pip install -U huggingface_hub
hf download MiniMaxAI/MiniMax-VL-01

הקבצים

445 קבצים במאגר, 853 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בעמוד המודל מופיע שהרישיון לא דווח, אף שקיים קובץ הסכם נפרד במאגר. במצב כזה אין אישור שימוש ברור ומיידי, ואסור לשלב את המשקלים במוצר מסחרי לפני שבודקים את נוסח ההסכם המלא ישירות מול MiniMax.

הרישיון המלא בעמוד המודל ↗