GPT
M

MiMo-VL-7B-RL-2508

קוד פתוח

XiaomiMiMomit2025-08-07

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • conversational

מודל ראייה ושפה קומפקטי שמביא חשיבה מבוססת חיזוקים לניתוח תמונות ווידאו. הוא מתאים למי שרוצה ביצועי ראייה גבוהים מקומית בלי לגרור משקלי ענק.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 1,636הורדות בחודש

מה זה

שיאומי בנתה כאן מודל ראייה ושפה שמבוסס על שילוב של מקודד תמונה ברזולוציה טבעית, שכבת חיבור ומודל שפה שאומן לחשיבה מורכבת. המודל עבר אימון קדם בארבעה שלבים ואחריו כוונון בחיזוקים שמשלב אותות של תפיסה חזותית, עיגון אלמנטים בתמונה, היגיון והעדפות אנושיות.

במדדים שפורסמו הוא מציג תוצאות חריגות למשקל שלו, כמו 70.6 במבחן MMMU וציון של 70.8 בבדיקות וידאו של VideoMME. מעבר ליכולות הראייה הכלליות, הכותבים מציגים תוצאות גבוהות במיוחד בהבנת ממשקי משתמש ומיקום רכיבים על מסך, לצד דירוג פנימי שעקף לפי הדיווח שלהם גם מודלים פתוחים גדולים בהרבה.

מתאים ל

  • ניתוח מסכים וממשקים

    זיהוי אלמנטים וכפתורים בממשקי תוכנה בזכות אימון ייעודי לעיגון חזותי.

  • תחקור סרטוני וידאו

    מענה על שאלות מורכבות מתוך קובצי וידאו ארוכים עם ציון 70.8 בבנצ'מרק VideoMME.

  • משימות חילוץ מידע מתמונות

    שליפת נתונים וזיהוי ישיר במצב ללא חשיבה כדי לקבל תשובות מהירות וממוקדות.

איפה זה נופל

החולשה העיקרית שמצוינת בדוח נובעת דווקא משלב האימון בחיזוקים, שבו שילוב משימות מתחומים שונים יצר התנגשויות והשפעות הדדיות בין סוגי המידע. בנוסף, שליטה במצב החשיבה מחייבת משמעת נוקשה בניסוח הפרומפט, שכן הפקודה לכיבוי החשיבה חייבת להופיע בסוף הטקסט ממש, ואם תוסיפו קובץ מדיה אחריה ההתנהגות תשתבש.

שאלות
נפוצות

איך מכבים את שרשרת המחשבה כדי לקבל תשובה קצרה?

מוסיפים את הפקודה no_think בתור הטקסט האחרון בהודעה שלכם. היוצרים מדווחים על הצלחה של מעל 99 אחוז במעבר לתשובה ישירה, אבל חובה לוודא שאין שום תמונה או טקסט נוסף אחרי הפקודה.

מה ההבדל בין גרסת ה־RL הזו לגרסת ה־SFT?

גרסת ה־RL עברה שלב אימון נוסף עם למידת חיזוקים והיא מיועדת לשימוש ישיר, להסקה ולמשימות קצה. גרסת ה־SFT נועדה בעיקר למפתחים שמתכננים לבצע אימון המשך בעצמם ומחפשים בסיס יציב לכוונון נוסף.

איך מריצים

המשקל שוקל כ־15.5 ג׳יגהבייט בקבצי bfloat16, כך שתצטרכו כרטיס גרפי עם מספיק זיכרון וידאו כדי לטעון אותו ולשמור מקום לחלון הקשר ארוך. הוא רץ ישירות דרך ספריית transformers תחת הארכיטקטורה של Qwen2_5_VLForConditionalGeneration.

היוצרים ממליצים להריץ אותו עם ערכי טמפרטורה של 0.3 ו־topp של 0.95, כשההנחיה הראשית כבר מוגדרת מראש בתבנית השיחה. תמיד חייבים לשים את התמונה או הווידאו לפני הטקסט במבנה ההודעה, ואם רוצים תשובה ישירה ומהירה בלי שרשרת חשיבה, מוסיפים no_think בסוף הפנייה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="XiaomiMiMo/MiMo-VL-7B-RL-2508")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון mit, שזה הרישיון הכי פתוח ומאפשר שיש. אתם יכולים לקחת את המשקלים, לשלב אותם במוצר מסחרי, לשנות, לכוונן ולהפיץ מחדש בלי הגבלות שימוש, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗